工具标签

LLM评测

LLM评测 相关内容共 6 条,工具 6 个,文章 0 篇。 标签内容会持续更新,以下为当前收录结果。
标签结果 标签专题页
相关工具 共 6 个
工具 模型与训练 6115 热门度

AGI-Eval

AGI-Eval是由上海交大同济华师大美团DataWhale联合发起的国内头部大模型评测社区提供模型排行榜人机协同评测500+评测集和DataStudio数据工坊覆盖GPT...

工具 模型与训练 6054 热门度

LLMEval

LLMEval是复旦大学NLP实验室的大语言模型评测研究项目已发表AAAIEMNLPACL顶会论文构建覆盖13学科22万题目的评测框架基准59个LLM主要用于学术研究而非普...

工具 模型与训练 3003 热门度

HELM

HELM是斯坦福大学基础模型研究中心推出的语言模型全面评估框架,通过标准化的多维度基准测试对各类大语言模型进行系统性评测和排名,覆盖模型、场景和结果三大维度,为AI研究社区...

工具 模型与训练

Ragas

Ragas 是用于评测 RAG 和 LLM 应用质量的工具框架,适合开发团队检查检索、生成、事实性和回答质量。

工具 模型与训练

Humanloop

Humanloop 是面向团队的 Prompt 管理、评测和 LLM 应用优化平台,适合把提示词和模型配置纳入更规范的开发流程。

工具 模型与训练

Phoenix评测

Arize AI Phoenix 是面向机器学习和 LLM 应用的可观测、评测与调试工具,适合团队检查模型质量、RAG 链路和线上应用表现。