AGI-Eval
AGI-Eval是由上海交大同济华师大美团DataWhale联合发起的国内头部大模型评测社区提供模型排行榜人机协同评测500+评测集和DataStudio数据工坊覆盖GPT...
AGI-Eval是由上海交大同济华师大美团DataWhale联合发起的国内头部大模型评测社区提供模型排行榜人机协同评测500+评测集和DataStudio数据工坊覆盖GPT...
LLMEval是复旦大学NLP实验室的大语言模型评测研究项目已发表AAAIEMNLPACL顶会论文构建覆盖13学科22万题目的评测框架基准59个LLM主要用于学术研究而非普...
HELM是斯坦福大学基础模型研究中心推出的语言模型全面评估框架,通过标准化的多维度基准测试对各类大语言模型进行系统性评测和排名,覆盖模型、场景和结果三大维度,为AI研究社区...
Ragas 是用于评测 RAG 和 LLM 应用质量的工具框架,适合开发团队检查检索、生成、事实性和回答质量。
Humanloop 是面向团队的 Prompt 管理、评测和 LLM 应用优化平台,适合把提示词和模型配置纳入更规范的开发流程。
Arize AI Phoenix 是面向机器学习和 LLM 应用的可观测、评测与调试工具,适合团队检查模型质量、RAG 链路和线上应用表现。
可以先从右侧相关标签或标签索引继续找相关文章。