Phase 13:评估与测试
确定性测试、LLM-as-Judge、黄金数据集
关键要点
- 三种评估对应三种场景:确定性 / 质量评估 / 回归防护
- LLM-as-Judge:用 LLM 评判 LLM,适合无固定标准的场景
- 黄金数据集并行跑(Promise.all),大幅提速
学习目标
- 理解非确定性输出为什么难测试
- 区分确定性测试、LLM-as-Judge、黄金数据集
- 能设计一条回归测试样例
标签:Evaluation · Testing · LLM-as-Judge · 回归测试
预计学习时间:38 分钟 | 难度:高级