FlagEval
FlagEval(天秤)是智源研究院推出的大模型评测体系及开放平台,支持大语言模型、多模态、计算机视觉、语音等多领域评测,提供科学、公正、开放的评测基准。
FlagEval(天秤)是智源研究院推出的大模型评测体系及开放平台,支持大语言模型、多模态、计算机视觉、语音等多领域评测,提供科学、公正、开放的评测基准。
ARC实验室是推动开源AGI研究的非营利组织,通过ARC-AGI基准测试衡量AI的流体智能,提供200万美元奖金池,用于判断对人类简单但对AI困难的任务差距。
PromptLayer是面向AIAgent和LLM应用的Prompt管理评测与可观测性平台适合统一管理提示词版本追踪调用链路做效果评估和上线前后回归测试
Braintrust 是用于评测、调试和持续改进 AI 产品的平台,适合团队围绕提示词、模型和数据集做系统化迭代。
可以先从右侧相关标签或标签索引继续找相关文章。