C-Eval 是什么,主要解决什么问题
C-Eval 是上海交通大学 SJTU-LIT 团队推出的中文大语言模型综合评测基准,主要解决中文 AI 领域缺乏系统、权威评测标准的问题。
在众多大模型发布时,每个厂商都声称自己的模型「更强」,但缺乏统一的标准来衡量。C-Eval 提供了覆盖 52 个学科、分为 STEM(科学、技术、工程、数学)、社会科学、人文科学、其他四大类的标准化测试题目,让不同模型可以在同一套标准下进行公平比较。对于需要选择模型的企业、评估模型进展的研究者和关注模型能力的开发者来说,C-Eval 的排行榜曾是一个重要的参考指标。
工具背景与可信度怎么看
C-Eval 由上海交通大学 SJTU-LIT 团队维护,有正式发表的学术论文(arXiv:2305.08322)和公开的 GitHub 仓库(github.com/SJTU-LIT/ceval),学术来源可信度较高。榜单上展示的各模型结果中,标注星号(*)的表示由 C-Eval 团队亲自测试得到,未标注星号的表示由用户提交预测结果后计算分数,透明度较好。
需要注意的是,官方网站已于 2025 年 7 月发布公告停止维护排行榜,测试集已公开到 HuggingFace。当前榜单上的结果不代表最新模型的排名。如果你需要评测新模型,建议直接下载 HuggingFace 上的测试集自行跑分。
核心功能
- 中文综合评测体系:覆盖 52 个学科,分为 STEM、社会科学、人文科学、其他四大类,对模型的通用中文知识能力进行全面评估。
- 公开排行榜:展示各模型的平均分和分类分数,区分「公开访问」和「非公开访问」的模型。
- 测试集公开发布:测试集已上传至 HuggingFace(ceval/ceval-exam),支持 Zero-shot 和 Few-shot 评测。
- 学术论文和开源代码:论文在 arXiv 公开,GitHub 提供完整的评测工具链。
适合哪些用户和场景
C-Eval 主要面向以下用户:
- AI 研究人员:需要标准化的中文评测基准来衡量模型进展、写论文时做对比实验。
- 企业技术选型者:在选择商用大模型时,参考 C-Eval 的学科分类分数来判断模型在特定领域的知识水平。
- 模型开发者:训练或微调中文模型后,用 C-Eval 测试集进行标准化评估。
不适合的场景:如果你只是普通用户想找一个「最好用的聊天机器人」,排行榜分数只是一个参考维度,实际体验更重要;C-Eval 评估的是知识能力而非对话能力、指令遵循能力或安全性。
使用前需要注意什么
- 排行榜已停更:官方声明自 2025 年 7 月起停止维护排行榜,当前页面显示的结果不代表最新模型。如需最新数据,需自行下载测试集评测。
- 评测不等于实际体验:C-Eval 衡量的是模型在选择题上的知识储备,不代表模型在开放对话、创作、代码等实际场景中的表现。
- 下载和使用方式:测试集已公开在 HuggingFace,评测代码在 GitHub。需要一定的技术能力才能自行运行评测。
- 模型分数差异:榜单中带 * 号和不带 * 号的结果来源不同(官方测试 vs 用户提交),直接比较时需注意这一差异。
和同类评测基准相比怎么选
在中文大模型评测领域,C-Eval 是较早推出且影响力较大的基准之一。与后来的评测集相比,它的优势在于学科覆盖全面(52 个学科)和较长的历史积累,许多早期模型论文都会引用 C-Eval 分数。但它的局限也很明显:排行榜已不再更新,且只评测选择题形式的知识能力。
如果你需要评估模型的中文综合知识水平,C-Eval 的公开测试集仍然是一个可用的工具。如果你需要评估模型的对话、代码、推理或安全性,建议结合其他评测基准一起使用。