C-Eval
C-Eval是上海交通大学推出的中文大模型评测基准,涵盖52个学科和4大类(STEM、社会科学、人文科学、其他),提供公开排行榜和HuggingFace测试集,适合研究人员...
C-Eval是上海交通大学推出的中文大模型评测基准,涵盖52个学科和4大类(STEM、社会科学、人文科学、其他),提供公开排行榜和HuggingFace测试集,适合研究人员...
LLMEval是复旦大学NLP实验室的大语言模型评测研究项目已发表AAAIEMNLPACL顶会论文构建覆盖13学科22万题目的评测框架基准59个LLM主要用于学术研究而非普...
Weka是怀卡托大学开发的经典开源Java机器学习软件,提供数据挖掘、分类、聚类和模型评估的图形化工具。了解其官网、功能和学术使用场景。
Langfuse是开源LLM工程平台,提供调用追踪、提示词管理、模型评估、实验和人工标注等完整LLMOps能力。基于OpenTelemetry标准,已有10万+工程师使用,...
Prolific是牛津大学联合创立的AI训练数据众包平台为AI实验室提供200000+全球参与者用于模型评估RLHF数据收集和安全测试被GoogleOpenAIAnthro...
Ragas 是用于评测 RAG 和 LLM 应用质量的工具框架,适合开发团队检查检索、生成、事实性和回答质量。
Scale AI 是面向数据标注、模型评估和企业 AI 数据服务的平台,适合需要高质量训练数据和模型评测的团队。
Humanloop 是面向团队的 Prompt 管理、评测和 LLM 应用优化平台,适合把提示词和模型配置纳入更规范的开发流程。
可以先从右侧相关标签或标签索引继续找相关文章。