给 AI Agent 建立可重复的评估回路
Agent 的“看起来能用”与“可以稳定交付”之间,隔着一套持续运行的评估回路。评估不是发布前的一次考试,而是每次修改提示词、工具或模型之后都能重新执行的反馈系统。
从真实任务开始
Section titled “从真实任务开始”先收集十到二十个真实任务,保留输入、上下文、理想结果和不可接受的结果。样本不必很多,但要覆盖高频任务、边界情况和曾经失败过的案例。
把判定写成规则
Section titled “把判定写成规则”能用确定性代码检查的部分,不交给模型判断;需要语义判断的部分,再使用评分量表和模型评审。
type Result = { passed: boolean; reason: string };
export function evaluate(hasCitation: boolean): Result { return hasCitation ? { passed: true, reason: '结果包含可核验来源' } : { passed: false, reason: '缺少来源' };}留下失败的形状
Section titled “留下失败的形状”不要只记录总分。失败输入、输出、原因和修改前后的差异,才是下一轮改进真正需要的材料。