传统测试都通过了,怎么证明 Agent 真的变好了
传统测试只能证明代码没坏,无法评估 Agent 是否真正变强。需要引入 Eval:用固定任务集、统一评分规则重复运行,比较成功率、成本、耗时和回归。两套体系互补,发布前先过传统测试,再跑 Eval,才能避免凭感觉优化。
传统测试只能证明代码没坏,无法评估 Agent 是否真正变强。需要引入 Eval:用固定任务集、统一评分规则重复运行,比较成功率、成本、耗时和回归。两套体系互补,发布前先过传统测试,再跑 Eval,才能避免凭感觉优化。
做 Coding Agent 后才明白,调用模型只是开始。长任务中,状态管理、工具记录、可观察性和失败恢复才是关键。聊天只是入口,系统要像 Runtime 一样持续推进并验证结果;稳定可靠往往比一次惊艳回答更重要。
ChatGPT 与 Codex 合并后协议再改,工具定义被移入 additional_tools,第三方模型收不到工具会假装调用。作者本地网关 AgentGate 已适配,将工具还原转发上游,合并版桌面端仍可指向本机调用 DeepSeek、
ReviewGate是一个开源MIT的代码合并前过滤工具,从安全、性能、逻辑和AI Smell等角度筛出高风险问题,分block/warn,宁可不通过也不给假绿灯。支持--fix、CI集成、误报共享,默认只读。建议先观察再逐步启用。
中年以后,健身的意义不再只是锻炼身体,更是主动为自己保留一段不被打扰的独处时间。它能让人从工作、家庭和碎片信息中暂时退出,恢复注意力与秩序,找回安静和独立思考的空间。这种“回到自己身上”的能力,比单纯的身体管理更重要。
一人做事时容易高估执行力,低估方向和节奏。执行力虽可见,但方向不对或节奏混乱时,越努力可能越偏离关键结果。真正重要的是不断判断主线、阶段重点和优先级,避免忙得真却无实质推进。方向感和节奏感比单纯猛冲更能决定长期稳定前进。
一个 AI 效率工具(闭门打磨中),同时接少量项目合作。
每周一篇,公众号先发,长文沉淀到博客。
Claude Code · Cursor · Next.js · Go · 自研 Otaro。
我长期做自己的产品,也接少量合适的项目合作。如果你有产品、系统、AI 工具或效率改造相关需求,欢迎邮件联系。
my@dengmengmian.com