AI编码agent持续开发中,会话结束时的状态质量直接决定下一个会话的效率。文章提出"清洁状态"五要素:构建通过、测试通过、进度已记录、临时工件已清理、启动路径可用,并对比了有无清洁策略的12周实测数据。同时介绍了双模式清理策略、质量文档维护、Harness定期简化、幂等清理操作及高吞吐量环境下的合并策略调整,强调技术
more...
AI编码agent持续开发中,会话结束时的状态质量直接决定下一个会话的效率。文章提出"清洁状态"五要素:构建通过、测试通过、进度已记录、临时工件已清理、启动路径可用,并对比了有无清洁策略的12周实测数据。同时介绍了双模式清理策略、质量文档维护、Harness定期简化、幂等清理操作及高吞吐量环境下的合并策略调整,强调技术
more...
Agent 执行任务时如同黑盒,缺乏可观测性导致无法区分正确与看似正确、评估主观化、重试盲目化及会话交接信息断崖。文章提出双层可观测性架构:运行时可观测性(系统层信号)与过程可观测性(决策工件可见性),核心工具包括冲刺合同、评估评分标准和任务轨迹。通过 Anthropic 三 Agent 架构实验验证,完整可观测性可将
more...
单元测试通过不代表任务完成,端到端测试才能暴露组件边界缺陷。文章以Electron文件导出功能为例,说明5个组件各自单元测试通过,但端到端运行时暴露接口不匹配、状态传播错误、资源泄漏等5个跨层问题。核心观点:端到端测试不仅检测系统级缺陷,还会改变AI agent的编码行为,使其更关注组件交互与架构边界。同时强调架构规则
more...
AI编码agent存在系统性过度自信倾向,常在任务未真正完成时提前宣告完成。根本原因在于agent依赖代码层面的局部信心做判断,而缺乏系统级验证。解决方案是将完成判定外部化,通过harness强制执行三层终止校验:语法静态分析、运行时行为验证、端到端系统确认。同时需避免agent在核心功能未验证前重构代码,并给agen
more...
功能清单不是备忘录,而是 harness 的基础原语。每个功能项必须包含三元组:行为描述、验证命令、当前状态,形成状态机模型(not_started/active/blocked/passing)。状态转移由 harness 控制,agent 只能通过验证命令才能将功能标为 passing,确保"做完"有客观标准而非模
more...
Agent 在单次任务中容易过度延伸(Overreach),同时启动多个功能导致所有任务都半途而废(Under-finish)。核心解决方法是强制 WIP=1 工作流:每次只做一个功能点,必须通过端到端验证后才能开始下一个。文章引入 Kanban 方法论中的在制品限制概念,提出"完成证据"必须可执行验证、"范围表面"需
more...
AI编码agent在多会话协作中,应将初始化阶段与功能实现阶段严格分离。初始化阶段专注于搭建可运行环境、配置验证测试框架、编写启动就绪清单和任务分解文档,而非直接写业务代码。混合进行会导致基础设施不牢、隐式假设累积、上下文预算浪费,后续会话需反复重建项目认知。采用独立初始化阶段配合项目模板热启动,可将后续会话重建时间从
more...
AI coding agent 在跨会话任务中面临上下文断裂困境:上下文窗口有限导致决策历史、验证状态等关键信息丢失,新会话需重新探索项目,造成重建成本高、决策漂移、重复劳动等问题。文章系统分析了"上下文焦虑"现象,提出通过 PROGRESS.md 进度文件、DECISIONS.md 决策日志、Git 检查点等结构化状
more...
指令文件膨胀是AI助手效能下降的主要陷阱。文章分析了"巨型AGENTS.md"的恶性循环:上下文预算被挤占、关键规则因"中间迷失"效应被忽略、优先级冲突、维护衰减和矛盾累积。核心解决方案是将指令拆分为短小的入口文件(50-200行)和按需加载的专题文档,提升信噪比,让agent把上下文预算花在真正任务上。通过SaaS团
more...