# harness **Repository Path**: danyuhao/harness ## Basic Information - **Project Name**: harness - **Description**: harness技术文档 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 2 - **Forks**: 0 - **Created**: 2026-04-01 - **Last Updated**: 2026-06-10 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Harness Engineering 工业级实践与架构规范 V2.0 > 文档定位:系统梳理2025-2026年全球顶尖机构在**Harness Engineering(智能体驾驭工程)** 领域的官方实践、核心架构与落地方法论,覆盖AI Agent软件工程、DevOps平台工程两大核心方向,为工程化落地提供权威参考。 > 版本更新:V2.0 补充核心架构定义、修正技术细节、统一文档结构与格式规范 --- ## 一、核心定义 Harness Engineering(智能体驾驭工程),是Agent-First时代诞生的全新软件工程范式,核心是将工程师的核心工作从「手动编写代码实现功能」,转向「设计约束与赋能兼备的执行环境、明确意图边界、构建自动化反馈闭环」,让AI智能体在可控、可预期、可扩展的框架内,稳定完成大规模、长周期的复杂工程任务。 其核心价值是通过标准化的Harness(驾驭脚手架),解决AI智能体在生产落地中的上下文漂移、架构失焦、错误累积、合规失控四大核心问题,实现研发效能数量级提升。 --- ## 二、全球顶尖机构官方实践(2025-2026最新) ### 2.1 OpenAI:Agent-First 世界的驾驭工程奠基性实践 **官方标题**:*Harness Engineering: Leveraging Codex in an Agent-First World* - **核心定位**:正式确立Harness Engineering作为独立工程学科的理论框架与工业级验证,是该领域的奠基性标杆实践。 - **核心内容**:通过5个月「零手动编写代码」的生产级项目实验,验证了Harness工程体系的可行性:3-7人工程师团队,通过Codex智能体完成百万行级代码库构建,合并1500+个PR,实现传统开发模式10倍的效率提升,明确了「人类定方向、智能体做执行」的全新研发范式。 - **关键技术细节**: - **地图式结构化知识库**:摒弃单一大体量指令手册,以100行左右的`AGENTS.md`为入口索引,构建分层级的仓库内知识体系,通过渐进式披露解决智能体上下文稀缺问题,配套自动化文档治理Agent保障知识新鲜度。 - **全链路可观测性架构**:将Chrome DevTools Protocol、完整可观测性栈(日志、指标、链路追踪)深度接入Agent运行时,让智能体可自主完成UI交互验证、性能指标优化、Bug复现与修复,支持单任务连续6小时以上的自主执行。 - **架构不变量强制体系**:通过自定义Linter与结构测试,刚性执行分层领域架构规则,约束代码依赖流向,实现「中心化强制边界、本地化实现自由」,避免高吞吐量下的架构漂移。 - **自动化熵增治理机制**:定义代码库「黄金原则」,通过周期性重构Agent实现代码库的自动化「垃圾回收」,持续对抗AI代码的模式复制与技术债务累积。 - **Agent-to-Agent评审闭环**:构建Ralph Wiggum Loop循环,实现智能体自我评审、多智能体交叉评审、反馈自动迭代的全流程自动化,大幅降低人工审核成本。 - **发布时间**:2026年2月11日 - **官方链接**:https://openai.com/index/harness-engineering/ ### 2.2 Anthropic:长运行智能体的Harness架构体系 #### 2.2.1 长运行智能体的高效Harness架构 **官方标题**:*Effective Harnesses for Long-running Agents* - **核心定位**:解决跨上下文窗口长周期任务中,智能体「逻辑偏移、状态丢失、过早完工」的核心痛点,提出工业级长运行任务的稳定性Harness框架。 - **核心内容**:针对Claude Agent SDK在多会话复杂任务中的失效模式,提出双Agent协作的Harness架构,解决了智能体跨轮次「失忆」问题,实现了生产级Web应用的全流程自主构建。 - **关键技术细节**: - **双Agent分工协作架构**:拆分任务为两大角色,Initializer Agent(初始化智能体)负责首次运行时的环境搭建、全量功能需求建模、执行框架初始化;Coding Agent(编码智能体)负责单会话增量式功能实现,通过Harness实现跨会话状态同步。 - **结构化状态追踪体系**:通过JSON格式的功能清单文件、`claude-progress.txt`进度日志、Git提交记录三大载体,实现新会话智能体的快速状态对齐,彻底解决上下文重置后的信息丢失问题。 - **增量式开发强制约束**:通过Harness规则强制编码智能体单次会话仅处理单个功能,完工后必须提交可合并的干净代码状态,避免「一步到位」导致的上下文耗尽与半成品代码。 - **端到端测试闭环**:将浏览器自动化工具(Puppeteer MCP)深度集成到Harness中,强制智能体完成功能开发后进行真实用户视角的全链路验证,仅验证通过才可标记功能完工。 - **发布时间**:2025年11月26日 - **官方链接**:https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents #### 2.2.2 长运行应用开发的Harness设计演进 **官方标题**:*Harness design for long-running application development* - **核心定位**:针对跨度数周的大型复杂项目,在初代Harness架构基础上,引入GAN式生成-评估闭环,解决智能体自评估失真、长周期任务质量失控问题。 - **核心内容**:突破单Agent与双Agent架构的局限,提出「Planner-Generator-Evaluator」三Agent Harness体系,实现了全栈应用、游戏引擎、DAW音频工作站等复杂项目的多小时自主开发,大幅提升生成质量与功能完成度。 - **关键技术细节**: - **三角色智能体协同架构**:Planner Agent(规划师)负责将极简用户提示扩写为完整产品规格与技术设计;Generator Agent(生成器)负责按冲刺周期迭代实现功能;Evaluator Agent(评估师)负责独立的功能验证、质量评分与缺陷反馈,三者通过Harness实现标准化的文件式协作与信息流转。 - **冲刺契约机制**:每个开发周期前,Generator与Evaluator通过Harness达成「完工标准契约」,明确功能的可验证交付标准,从源头避免需求偏差与功能 stub 化。 - **主观质量可量化体系**:将设计质量、原创性、工艺完成度、功能性四大主观维度拆解为可评分、可迭代的标准,解决前端设计等主观场景的智能体自评估宽容度问题。 - **上下文焦虑解决方案**:通过上下文重置+结构化状态交接的组合方案,解决模型接近上下文窗口上限时的提前完工问题,同时通过自动上下文压缩保障长会话的信息连续性。 - **发布时间**:2026年3月24日 - **官方链接**:https://www.anthropic.com/engineering/harness-design-long-running-apps ### 2.3 Google DeepMind:AutoHarness 自动代码驾驭框架 **官方标题**:*AutoHarness: improving LLM agents by automatically synthesizing a code harness* - **核心定位**:提出「AI自主构建AI执行环境」的技术方案,实现Harness代码的自动合成与迭代优化,是Harness工程自动化方向的突破性成果。 - **核心内容**:针对LLM智能体在环境交互中高频出现的非法操作、无效动作问题,证明了Gemini模型可通过少量环境反馈迭代,自动合成高可靠性的代码Harness,实现非法操作100%拦截,同时让中等参数模型实现超越旗舰大模型的任务表现。 - **关键技术细节**: - **自适应反馈闭环**:当智能体执行任务出现环境报错/非法操作时,AutoHarness可自动解析环境反馈,合成对应的异常捕获、边界约束与逻辑规约代码,无需人工介入即可完成Harness的迭代优化。 - **代码即策略极致优化**:可将智能体的决策逻辑完全转化为可执行的代码策略,彻底消除推理阶段的LLM调用,在保障任务效果的同时,大幅降低推理成本与延迟。 - **跨场景泛化能力**:在145款不同类型的TextArena游戏(单人/双人)中,实现非法操作100%拦截;在16款单人游戏中,优化后的Gemini-2.5-Flash平均奖励超越Gemini-2.5-Pro与GPT-5.2-High。 - **发布时间**:2026年2月10日提交,2026年3月正式收录于arXiv - **官方链接**:https://arxiv.org/pdf/2603.03329v1 ### 2.4 Stripe:工业级全自主编码智能体基础设施 **官方标题**:*Minions: Stripe's one-shot, end-to-end coding agents* - **核心定位**:全球首个大规模落地的企业级生产环境Agent Harness体系,验证了Harness Engineering在超大规模商业代码库中的可用性。 - **核心内容**:披露Stripe内部代号「Minions」的全自主编码智能体系统,通过高密度的Harness基础设施支撑,实现智能体每周处理超1300个生产环境PR,覆盖代码编写、测试、评审、合并全流程。 - **关键技术细节**: - **隔离式预热Devbox环境**:Harness为每个智能体任务动态分配预加载了完整依赖库、测试数据、运行时环境的隔离开发沙箱,保障任务间无干扰,同时大幅降低环境准备耗时。 - **Toolshed中心化工具服务**:Harness内置基于MCP协议的400+标准化工具集,统一管理智能体对文件系统、Git仓库、内部API、云服务的访问权限与调用规范,解决工具调用幻觉与权限失控问题。 - **确定性+智能体混合蓝图模式**:通过Harness将研发流程拆分为确定性节点与智能体节点,标准化流程由自动化脚本刚性执行,创意性/复杂性工作交由智能体完成,平衡效率与稳定性。 - **发布时间**:2026年3月 - **信息来源**:Stripe Engineering 官方技术披露、FounderPark 深度访谈 ### 2.5 Harness.io:DevOps 全链路智能驾驭平台 **官方标题**:*How Harness AI Helps Scale Platform-Wide Support* - **核心定位**:Harness Engineering在DevOps与平台工程领域的商业化落地标杆,验证了Harness架构在超大规模企业级软件交付场景的价值。 - **核心内容**:披露头部金融机构基于Harness AI平台的落地成果,通过SDLC全链路嵌入的Harness智能体系,实现95%的平台支持工单自动拦截与闭环处理,彻底解决研发效能提升后的「成功税」问题。 - **关键技术细节**: - **软件交付专属知识图谱**:Harness核心引擎基于企业级SDLC知识图谱,持续索引流水线、服务、环境、部署、策略、执行历史的全量关联数据,实现故障根因自动定位、策略违规解释、修复方案自动生成。 - **全链路AI嵌入架构**:将AI能力解耦并嵌入软件开发生命周期的每一个流水线节点,覆盖代码构建、安全扫描、部署发布、持续验证、故障自愈、成本治理全流程。 - **企业级合规与自治体系**:通过「黄金路径」模板化能力,实现企业级安全合规策略的全局强制落地,同时为业务开发者提供自助式研发能力,平衡管控与效率。 - **发布时间**:2026年3月25日 - **官方链接**:https://www.harness.io/blog/harness-ai-helps-scale-platform-wide-support --- ## 三、行业深度解读与落地实践案例 ### 3.1 Harness Engineering: 面向Agent-First世界的软件工程范式重构 - **发布平台**:CSDN 博客 - **发布时间**:2026年3月28日 - **核心内容**:深度拆解OpenAI零手写代码实验的技术细节,对比传统软件工程与Harness Engineering的范式差异,解析工程师角色从「代码实现者」到「环境设计师」的核心转变,提炼Harness工程的三大核心组件(上下文工程、架构约束、熵增治理)与落地实施路径。 - **原文链接**:https://blog.csdn.net/dnnyyq/article/details/158624427 ### 3.2 一些 Harness Engineering 的实践 - **发布平台**:阿里云开发者社区 - **发布时间**:2026年3月20日 - **核心内容**:聚焦Anthropic长运行Agent Harness的核心设计思路,拆解双Agent架构的解决的核心痛点与落地细节,同时横向对比OpenAI、Stripe、LangChain的实践差异,总结出Harness工程的通用落地原则。 - **原文链接**:https://developer.aliyun.com/article/1718179 ### 3.3 LangChain 排名跃升背后的 Harness Engineering 实践 - **发布平台**:稀土掘金 - **发布时间**:2026年3月27日 - **核心内容**:完整还原LangChain开源项目的Harness化改造全流程,从研发流程、社区协作、质量管控三个维度,拆解开源项目如何通过Harness Engineering实现PR合并效率提升70%、发布频率提升5倍、社区贡献者数量翻倍,提供了开源场景的可复制落地框架。 - **原文链接**:https://juejin.cn/post/7621718561626898467 ### 3.4 Harness: 接管生产环境的「智能大脑」,正在用平台工程谋杀传统 DevOps - **发布平台**:CSDN 博客 - **发布时间**:2026年4月1日 - **核心内容**:聚焦Harness.io平台的企业级落地实践,拆解边缘计算全自动发布、AI金丝雀发布、云成本智能管控、合规主动拦截四大核心场景的落地方案,对比Harness平台与传统DevOps工具的代际差异,明确了不同规模团队的适配选型建议。 - **原文链接**:https://blog.csdn.net/keshi_curry/article/details/159415923 --- ## 四、延伸:Harness 思维在知识学习领域的落地方法 Harness Engineering的核心逻辑——「搭建可控框架、明确核心目标、构建反馈闭环、实现自主迭代」,同样可迁移至AI辅助学习场景。2026年3月出圈的MIT研究生48小时完成一门学科学习的案例,其核心正是基于Harness思维重构了学习路径,核心三步法如下: 1. **第一步(搭骨架:构建学习框架Harness)**:向AI提问「这个领域所有专家共同遵循的5个核心心智模型是什么?请用通俗语言解释并搭配实际案例」,20分钟内掌握学科底层的专家级思考框架,而非陷入零散的知识点,为AI辅助学习划定清晰的边界与主线。 2. **第二步(辨边界:明确认知的约束范围)**:追问AI「这个领域专家们存在根本性分歧的3个核心方向是什么?以及每一方最有力的论据是什么?」,快速厘清学科的共识、争议与前沿开放问题,构建完整的学科认知地图,避免AI信息投喂带来的认知片面性。 3. **第三步(验掌握:构建反馈闭环)**:让AI基于上述内容生成10道深度测试题,通过「作答-纠错-追问」的闭环,区分「信息熟悉感」和「真正的知识内化」,快速暴露知识盲区并补全,实现学习效果的自主验证与迭代。