C-Eval

访问官网

C-Eval是上海交通大学推出的中文大模型评测基准,涵盖52个学科和4大类(STEM、社会科学、人文科学、其他),提供公开排行榜和HuggingFace测试集,适合研究人员和开发者评估模型中文能力。

分类: AI开发与模型模型与训练 #排行榜 #模型与训练 #模型评估 #大模型评测 #中文基准 #评测数据集

C-Eval 是什么,主要解决什么问题

C-Eval 是上海交通大学 SJTU-LIT 团队推出的中文大语言模型综合评测基准,主要解决中文 AI 领域缺乏系统、权威评测标准的问题。

在众多大模型发布时,每个厂商都声称自己的模型「更强」,但缺乏统一的标准来衡量。C-Eval 提供了覆盖 52 个学科、分为 STEM(科学、技术、工程、数学)、社会科学、人文科学、其他四大类的标准化测试题目,让不同模型可以在同一套标准下进行公平比较。对于需要选择模型的企业、评估模型进展的研究者和关注模型能力的开发者来说,C-Eval 的排行榜曾是一个重要的参考指标。

工具背景与可信度怎么看

C-Eval 由上海交通大学 SJTU-LIT 团队维护,有正式发表的学术论文(arXiv:2305.08322)和公开的 GitHub 仓库(github.com/SJTU-LIT/ceval),学术来源可信度较高。榜单上展示的各模型结果中,标注星号(*)的表示由 C-Eval 团队亲自测试得到,未标注星号的表示由用户提交预测结果后计算分数,透明度较好。

需要注意的是,官方网站已于 2025 年 7 月发布公告停止维护排行榜,测试集已公开到 HuggingFace。当前榜单上的结果不代表最新模型的排名。如果你需要评测新模型,建议直接下载 HuggingFace 上的测试集自行跑分。

核心功能

  • 中文综合评测体系:覆盖 52 个学科,分为 STEM、社会科学、人文科学、其他四大类,对模型的通用中文知识能力进行全面评估。
  • 公开排行榜:展示各模型的平均分和分类分数,区分「公开访问」和「非公开访问」的模型。
  • 测试集公开发布:测试集已上传至 HuggingFace(ceval/ceval-exam),支持 Zero-shot 和 Few-shot 评测。
  • 学术论文和开源代码:论文在 arXiv 公开,GitHub 提供完整的评测工具链。

适合哪些用户和场景

C-Eval 主要面向以下用户:

  • AI 研究人员:需要标准化的中文评测基准来衡量模型进展、写论文时做对比实验。
  • 企业技术选型者:在选择商用大模型时,参考 C-Eval 的学科分类分数来判断模型在特定领域的知识水平。
  • 模型开发者:训练或微调中文模型后,用 C-Eval 测试集进行标准化评估。

不适合的场景:如果你只是普通用户想找一个「最好用的聊天机器人」,排行榜分数只是一个参考维度,实际体验更重要;C-Eval 评估的是知识能力而非对话能力、指令遵循能力或安全性。

使用前需要注意什么

  • 排行榜已停更:官方声明自 2025 年 7 月起停止维护排行榜,当前页面显示的结果不代表最新模型。如需最新数据,需自行下载测试集评测。
  • 评测不等于实际体验:C-Eval 衡量的是模型在选择题上的知识储备,不代表模型在开放对话、创作、代码等实际场景中的表现。
  • 下载和使用方式:测试集已公开在 HuggingFace,评测代码在 GitHub。需要一定的技术能力才能自行运行评测。
  • 模型分数差异:榜单中带 * 号和不带 * 号的结果来源不同(官方测试 vs 用户提交),直接比较时需注意这一差异。

和同类评测基准相比怎么选

在中文大模型评测领域,C-Eval 是较早推出且影响力较大的基准之一。与后来的评测集相比,它的优势在于学科覆盖全面(52 个学科)和较长的历史积累,许多早期模型论文都会引用 C-Eval 分数。但它的局限也很明显:排行榜已不再更新,且只评测选择题形式的知识能力。

如果你需要评估模型的中文综合知识水平,C-Eval 的公开测试集仍然是一个可用的工具。如果你需要评估模型的对话、代码、推理或安全性,建议结合其他评测基准一起使用。

继续探索 AI 工具

从同类、热门或新收录工具里快速找下一站。

返回工具列表