SuperCLUE
SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队维护,覆盖语言理解、知识应用、逻辑推理、代码生成、安全性等10大能力维度,按月更新榜单。包含OPEN、OPT...
SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队维护,覆盖语言理解、知识应用、逻辑推理、代码生成、安全性等10大能力维度,按月更新榜单。包含OPEN、OPT...
AGI-Eval是由上海交大同济华师大美团DataWhale联合发起的国内头部大模型评测社区提供模型排行榜人机协同评测500+评测集和DataStudio数据工坊覆盖GPT...
C-Eval是上海交通大学推出的中文大模型评测基准,涵盖52个学科和4大类(STEM、社会科学、人文科学、其他),提供公开排行榜和HuggingFace测试集,适合研究人员...
MMBench是由上海人工智能实验室OpenCompass(司南)团队维护的多模态大模型评测基准与排行榜。它并非AI功能产品,而是一个用于衡量多模态大模型在视觉理解、推理和...
FlagEval(天秤)是智源研究院推出的大模型评测体系及开放平台,支持大语言模型、多模态、计算机视觉、语音等多领域评测,提供科学、公正、开放的评测基准。
可以先从右侧相关标签或标签索引继续找相关文章。