社区概述
AGI-Eval是由上海交通大学、同济大学、华东师范大学、美团和DataWhale联合发起的大模型评测社区,以"评测助力,让AI成为我们更好的伙伴"为使命。该社区致力于构建长生命周期的评测体系,打造公正、可信、科学、全面的评测生态,评估大语言模型及多模态模型在各类任务中的通用人工智能(AGI)能力。平台用户已达20000+,评测集社区收录超100个高价值评测集,专家学者人数超300人。
核心功能
AGI-Eval平台提供四大核心服务。模型排行榜:基于通用评测方案提供业内大语言模型和多模态模型的能力得分排名,涵盖综合评测和各能力项评测(理解、推理、知识、计算等),数据透明权威、定期更新。榜单已收录GPT-5.5、Gemini-3.1-Pro、DeepSeek-V4-Pro、Qwen3.7-Max、Doubao-Seed-2.0-Pro、Kimi-K2.6、Claude-Opus-4.6等国内外主流模型。人机协同评测:创新性地采用人机协作评测模式,用户与大模型共同完成任务,系统基于多轮对话数据产出高置信度评测结论。平台还支持"动态分离式追问机制",为每个模型独立设计追问路径,更逼近真实对话场景。评测集社区:包含公开学术评测集(行业标准数据集,支持下载使用)、官方自建评测集(覆盖多领域)和用户自建评测集(支持用户上传共建开源社区)。Data Studio数据工坊:30000+众包用户提供高质量真实数据,支持单条数据、扩写数据、Arena数据等多元化收集方式,配备机审+人审双重审核机制保障数据质量。
技术架构
AGI-Eval的开源评测框架(GitHub: AGI-Eval-Official/agi-eval)采用插件化架构,从数据处理到指标计算每个环节均可实现为插件自由组合,无需修改主框架。支持单机运行、本地调试和多进程并行等多种运行模式。内置AGI-Eval-OA-Judge专用打分模型,并配套Web可视化报告功能,支持指标统计、模型对比和错误样例查看。使用文档详见docs.agi-eval.cn。
合作生态与重要成果
AGI-Eval与多个高校和企业团队合作产出重要评测基准:OlympicArena——与GAIR Lab合作发布的严苛AI基准,涵盖七大学科奥赛题目;VitaBench——与美团LongCat团队合作发布的基于复杂生活场景的交互式Agent评测基准,覆盖外卖点餐、餐厅就餐、旅游出行三大场景;RM-Bench——托管知名团队的完整评测数据集,研究人员可直接利用业界认可资源进行模型验证。此外,AGI-Eval还推出"评测合伙人计划",为评测研究团队提供学术曝光渠道、免费评测集托管服务、学术资助金和算力资源等支持。
适用用户
AGI-Eval主要面向五类用户:AI研究人员,利用评测框架开展模型能力对比和方法论研究;LLM开发团队,通过客观榜单和数据集评估自有模型与竞品的差距;企业技术选型团队,基于多维度评测数据为业务场景选择合适的模型;数据贡献者,通过Data Studio参与数据贡献和众包标注;普通AI关注者,通过排行榜了解各模型的最新能力排名。
收录建议
AGI-Eval是国内影响力较大的大模型评测社区,学术资质扎实(上海交大+同济+华师大+美团联合)、功能完善、数据透明。当前站内名称误写为"AG1-Eval"(数字1而非字母I),需修正为"AGI-Eval"。强烈建议导入。