01传统测试都通过了,怎么证明 Agent 真的变好了传统测试只能证明代码没坏,无法评估 Agent 是否真正变强。需要引入 Eval:用固定任务集、统一评分规则重复运行,比较成功率、成本、耗时和回归。两套体系互补,发布前先过传统测试,再跑 Eval,才能避免凭感觉优化。#Agent开发#AI评测Eval#大模型应用开发2026/08/21