AI编码agent存在系统性过度自信倾向,常在任务未真正完成时提前宣告完成。根本原因在于agent依赖代码层面的局部信心做判断,而缺乏系统级验证。解决方案是将完成判定外部化,通过harness强制执行三层终止校验:语法静态分析、运行时行为验证、端到端系统确认。同时需避免agent在核心功能未验证前重构代码,并给agen
more...
AI编码agent存在系统性过度自信倾向,常在任务未真正完成时提前宣告完成。根本原因在于agent依赖代码层面的局部信心做判断,而缺乏系统级验证。解决方案是将完成判定外部化,通过harness强制执行三层终止校验:语法静态分析、运行时行为验证、端到端系统确认。同时需避免agent在核心功能未验证前重构代码,并给agen
more...
功能清单不是备忘录,而是 harness 的基础原语。每个功能项必须包含三元组:行为描述、验证命令、当前状态,形成状态机模型(not_started/active/blocked/passing)。状态转移由 harness 控制,agent 只能通过验证命令才能将功能标为 passing,确保"做完"有客观标准而非模
more...
Agent 在单次任务中容易过度延伸(Overreach),同时启动多个功能导致所有任务都半途而废(Under-finish)。核心解决方法是强制 WIP=1 工作流:每次只做一个功能点,必须通过端到端验证后才能开始下一个。文章引入 Kanban 方法论中的在制品限制概念,提出"完成证据"必须可执行验证、"范围表面"需
more...
AI编码agent在多会话协作中,应将初始化阶段与功能实现阶段严格分离。初始化阶段专注于搭建可运行环境、配置验证测试框架、编写启动就绪清单和任务分解文档,而非直接写业务代码。混合进行会导致基础设施不牢、隐式假设累积、上下文预算浪费,后续会话需反复重建项目认知。采用独立初始化阶段配合项目模板热启动,可将后续会话重建时间从
more...
AI coding agent 在跨会话任务中面临上下文断裂困境:上下文窗口有限导致决策历史、验证状态等关键信息丢失,新会话需重新探索项目,造成重建成本高、决策漂移、重复劳动等问题。文章系统分析了"上下文焦虑"现象,提出通过 PROGRESS.md 进度文件、DECISIONS.md 决策日志、Git 检查点等结构化状
more...
指令文件膨胀是AI助手效能下降的主要陷阱。文章分析了"巨型AGENTS.md"的恶性循环:上下文预算被挤占、关键规则因"中间迷失"效应被忽略、优先级冲突、维护衰减和矛盾累积。核心解决方案是将指令拆分为短小的入口文件(50-200行)和按需加载的专题文档,提升信噪比,让agent把上下文预算花在真正任务上。通过SaaS团
more...
AI agent 的工作世界仅限于代码仓库,无法访问 Slack、Jira、Confluence 等外部信息源。文章提出"仓库即规范"原则,强调将架构决策、运行约束、项目进度等关键知识就近写入仓库文件(如 AGENTS.md、ARCHITECTURE.md、PROGRESS.md),通过"全新会话测试"检验知识可见性,
more...
Harness 是 AI coding agent 发挥能力的关键工程基础设施,由指令、工具、环境、状态、反馈五个子系统组成。文章通过类比新入职工程师的困境,对比 Claude Code、Cursor、Codex 等工具的设计差异,结合 OpenAI 与 Anthropic 的官方实践,系统阐述了 harness 的核
more...
AI coding agent 的失败往往并非模型能力不足,而是执行环境(harness)存在结构性缺陷。文章通过 Anthropic 和 OpenAI 的对照实验,论证了同一模型在有无完整 harness 的环境下表现差异巨大,提出 harness 工程五层防御框架(任务规范、上下文供给、执行环境、验证反馈、状态管理
more...