01传统测试都通过了,怎么证明 Agent 真的变好了传统测试只能证明代码没坏,无法评估 Agent 是否真正变强。需要引入 Eval:用固定任务集、统一评分规则重复运行,比较成功率、成本、耗时和回归。两套体系互补,发布前先过传统测试,再跑 Eval,才能避免凭感觉优化。#Agent开发#AI评测Eval#大模型应用开发2026/08/21
02我做了一个 Coding Agent,才发现调用模型只是开始做 Coding Agent 后才明白,调用模型只是开始。长任务中,状态管理、工具记录、可观察性和失败恢复才是关键。聊天只是入口,系统要像 Runtime 一样持续推进并验证结果;稳定可靠往往比一次惊艳回答更重要。#效率提升#产品思维#AI编程2026/08/21
03ChatGPT 和 Codex 合并了,协议又动了一刀ChatGPT 与 Codex 合并后协议再改,工具定义被移入 additional_tools,第三方模型收不到工具会假装调用。作者本地网关 AgentGate 已适配,将工具还原转发上游,合并版桌面端仍可指向本机调用 DeepSeek、#本地网关#协议转换#AI编程2026/08/21
04分享个我自用的小工具(自己做的)ReviewGate是一个开源MIT的代码合并前过滤工具,从安全、性能、逻辑和AI Smell等角度筛出高风险问题,分block/warn,宁可不通过也不给假绿灯。支持--fix、CI集成、误报共享,默认只读。建议先观察再逐步启用。#需求验证#AI编程2026/08/21
05中年以后,健身不只是为了身体,也是为了保住独处和思考的时间中年以后,健身的意义不再只是锻炼身体,更是主动为自己保留一段不被打扰的独处时间。它能让人从工作、家庭和碎片信息中暂时退出,恢复注意力与秩序,找回安静和独立思考的空间。这种“回到自己身上”的能力,比单纯的身体管理更重要。#一人做事#节奏感2026/08/21
06一人做事最容易高估执行力,低估方向和节奏一人做事时容易高估执行力,低估方向和节奏。执行力虽可见,但方向不对或节奏混乱时,越努力可能越偏离关键结果。真正重要的是不断判断主线、阶段重点和优先级,避免忙得真却无实质推进。方向感和节奏感比单纯猛冲更能决定长期稳定前进。#执行力#方向感#节奏感2026/07/29
07我喜欢用 Codex,但它用不了 DeepSeek,所以我做了一个本地网关作者因喜欢Codex但希望使用DeepSeek模型,发现两者协议不兼容,于是开发了本地网关AgentGate。该工具将Codex的Responses API请求转换为DeepSeek支持的Chat Completions格式,并进一步实现智能路由:纯文本任务自动走DeepSeek,含图片的多模态任务自动切换至KimiCoding,解决了AI编程中工具与模型协议碎片化的问题,让用户专注代码开发。#本地网关#协议转换#AI编程2026/07/29
08为什么很多项目最后不赚钱,不是因为开发慢,而是因为边界失控项目不赚钱常被归因于开发慢,但更关键的是边界失控。开发慢影响效率,边界失控则破坏利润结构。小需求不断累积,使项目范围膨胀,报价失真,利润被逐步蚕食。守住边界比提升效率更重要,需明确不做什么、指定决策人、警惕小改动累积、清晰验收标准。#边界失控#项目利润#需求蔓延2026/07/29