DeepEval 是面向 LLM 应用的测试、评测和回归验证工具,适合把 AI 输出质量纳入工程测试流程。
Braintrust 是用于评测、调试和持续改进 AI 产品的平台,适合团队围绕提示词、模型和数据集做系统化迭代。
可以先从右侧相关标签或标签索引继续找相关文章。