工具标签

模型评估

模型评估 相关内容共 8 条,工具 8 个,文章 0 篇。 标签内容会持续更新,以下为当前收录结果。
标签结果 标签专题页
相关工具 共 8 个
工具 模型与训练 6109 热门度

C-Eval

C-Eval是上海交通大学推出的中文大模型评测基准,涵盖52个学科和4大类(STEM、社会科学、人文科学、其他),提供公开排行榜和HuggingFace测试集,适合研究人员...

工具 模型与训练 6054 热门度

LLMEval

LLMEval是复旦大学NLP实验室的大语言模型评测研究项目已发表AAAIEMNLPACL顶会论文构建覆盖13学科22万题目的评测框架基准59个LLM主要用于学术研究而非普...

工具 开发框架与开源 3414 热门度

Weka

Weka是怀卡托大学开发的经典开源Java机器学习软件,提供数据挖掘、分类、聚类和模型评估的图形化工具。了解其官网、功能和学术使用场景。

工具 开发框架与开源 2051 热门度

Langfuse

Langfuse是开源LLM工程平台,提供调用追踪、提示词管理、模型评估、实验和人工标注等完整LLMOps能力。基于OpenTelemetry标准,已有10万+工程师使用,...

工具 代码助手 1454 热门度

Prolific

Prolific是牛津大学联合创立的AI训练数据众包平台为AI实验室提供200000+全球参与者用于模型评估RLHF数据收集和安全测试被GoogleOpenAIAnthro...

工具 模型与训练

Ragas

Ragas 是用于评测 RAG 和 LLM 应用质量的工具框架,适合开发团队检查检索、生成、事实性和回答质量。

工具 企业服务

Scale AI

Scale AI 是面向数据标注、模型评估和企业 AI 数据服务的平台,适合需要高质量训练数据和模型评测的团队。

工具 模型与训练

Humanloop

Humanloop 是面向团队的 Prompt 管理、评测和 LLM 应用优化平台,适合把提示词和模型配置纳入更规范的开发流程。