公开实验室
独立开发 × AI
持续构建中
02 / 最近写作
记录判断、过程与仍然没有答案的问题。
传统测试都通过了,怎么证明 Agent 真的变好了
传统测试只能证明代码没坏,无法评估 Agent 是否真正变强。需要引入 Eval:用固定任务集、统一评分规则重复运行,比较成功率、成本、耗时和回归。两套体系互补,发布前先过传统测试,再跑 Eval,才能避免凭感觉优化。
我做了一个 Coding Agent,才发现调用模型只是开始
做 Coding Agent 后才明白,调用模型只是开始。长任务中,状态管理、工具记录、可观察性和失败恢复才是关键。聊天只是入口,系统要像 Runtime 一样持续推进并验证结果;稳定可靠往往比一次惊艳回答更重要。
ChatGPT 和 Codex 合并了,协议又动了一刀
ChatGPT 与 Codex 合并后协议再改,工具定义被移入 additional_tools,第三方模型收不到工具会假装调用。作者本地网关 AgentGate 已适配,将工具还原转发上游,合并版桌面端仍可指向本机调用 DeepSeek、
分享个我自用的小工具(自己做的)
ReviewGate是一个开源MIT的代码合并前过滤工具,从安全、性能、逻辑和AI Smell等角度筛出高风险问题,分block/warn,宁可不通过也不给假绿灯。支持--fix、CI集成、误报共享,默认只读。建议先观察再逐步启用。
