Skip to content
菜单
人工智能

给 AI Agent 建立可重复的评估回路

生长中

Agent 的“看起来能用”与“可以稳定交付”之间,隔着一套持续运行的评估回路。评估不是发布前的一次考试,而是每次修改提示词、工具或模型之后都能重新执行的反馈系统。

先收集十到二十个真实任务,保留输入、上下文、理想结果和不可接受的结果。样本不必很多,但要覆盖高频任务、边界情况和曾经失败过的案例。

能用确定性代码检查的部分,不交给模型判断;需要语义判断的部分,再使用评分量表和模型评审。

evaluate.ts
type Result = { passed: boolean; reason: string };
export function evaluate(hasCitation: boolean): Result {
return hasCitation
? { passed: true, reason: '结果包含可核验来源' }
: { passed: false, reason: '缺少来源' };
}

不要只记录总分。失败输入、输出、原因和修改前后的差异,才是下一轮改进真正需要的材料。