
一、AI编程进入"工程系统"时代
2026年,AI编程已经跨越了"新奇玩具"阶段,形成了一个清晰的三层技术体系[1]:
- 模型层:Claude Opus / GPT-5 等大模型提供基础推理与代码生成能力,是AI编程的"大脑"
- 执行层:Claude Code、Codex Agent 等编程Agent将大模型能力封装为可调度的工程化执行单元,是AI编程的"双手"
- 工具层:MCP协议与Skills体系解决Agent与外部工具的标准化连接问题,是AI编程的"神经系统"
这场变革的本质是从"单体大模型"到"数字员工集群"的范式转变。早期的AI编程依赖单个大模型完成所有工作,效果受限于上下文窗口和单次推理质量。而2026年的工程系统范式下,多个Agent分工协作,每个Agent专注特定环节,通过持久化的工程结构保障工作质量——正如传统软件工程通过代码规范、版本控制、CI/CD流水线来保障质量一样。
OpenClaw(2025年11月发布,180K+ GitHub stars)作为开源AI Agent编排框架,凭借Gateway网关架构和13000+现成技能,已成为多平台集成的首选方案。Claude Code 的Explore→Plan→Implement→Commit四阶段工作流,天然匹配研发生命周期。MCP协议(Anthropic开源,2026年3000+ Server)已成为Agent工具调用的事实标准[2]。
核心愿景:用户在飞书发一句话需求,AI团队自主完成从需求分析、方案设计、编码开发、测试验证到部署上线的全流程,人类仅在最关键的4个决策点进行审核确认。
本平台的设计目标可以概括为四个数字:80% Agent自主推进、4阶 HITL确认门控、2核4G 最低部署门槛、15分钟 快速启动。适用场景覆盖3-10人小公司/创业团队、企业内部工具团队,以及外包/项目制团队。
AI Harness:AI管控体系
AI Harness(AI管控体系)是本平台的核心设计理念——包裹在大模型外面的一整套运行管控体系,把只会单次聊天的AI,变成能长期连续完成复杂工作的智能体(Agent)。它包含六大支柱:
- 任务流程(Task Workflow):Explore→Plan→Implement→Commit四阶段 + 六步研发流程(需求探索→RAD分析→计划拆解→实现开发→部署交付→可观测运营)
- 规则约束(Rule Constraints):SOUL.md人格设定、HITL四道确认门禁、安全边界(只读MCP/白名单命令)
- 工具调用(Tool Calling):MCP协议标准化工具接口 + Skills知识库双轨集成
- 自动纠错(Auto Correction):Checkpoint状态快照回滚、构建失败自动重试、测试失败自动修复
- 全程监控(Full Monitoring):Golden Signals(延迟/流量/错误/饱和度)、Token消耗追踪、全链路追踪
- 复盘迭代(Retrospective Iteration):任务完成后自动生成复盘报告、Skill持续优化、Memory长期记忆积累
二、技术选型:四大核心组件决策
构建AI自主持续交付平台(AI-CDP),需要四大核心组件的协同工作。以下是完整的选型对比矩阵:
| 组件角色 | 候选方案 | 最终选择 | 核心考量 |
|---|---|---|---|
| 控制中心 | OpenClaw / Hermes Agent / Harness Engineering | OpenClaw | Gateway统一入口 + Skill Engine调度 + 明文Memory + 沙箱隔离 |
| 执行引擎 | Claude Code / Codex CLI / Aider | Claude Code | 四阶段工作流匹配研发全生命周期 + 200K上下文 + 并行能力 |
| 工具集成 | MCP + Skills / LangChain Tools / 直接REST API | MCP + Skills双轨制 | MCP标准化通信 + Skills知识库解决SOP固化 |
| 交付平台 | Harness / GitHub Actions / GitLab CI | Harness CI/CD | 声明式Pipeline + Feature Flags灰度 + AIDA智能模块 |
2.1 控制中心:OpenClaw vs Hermes vs Harness
控制中心是整个平台的大脑,负责任务编排、Agent调度和流程管理。我们对三大主流框架进行全方位对比[3]:
| 维度 | OpenClaw | Hermes Agent | Harness (OpenHarness) |
|---|---|---|---|
| 核心定位 | 执行网关与技能平台 | 自主进化的持久化智能体 | AI Agent指挥系统 |
| 设计哲学 | Gateway-first(网关优先) | Agent-first(代理优先) | Orchestration-first(编排优先) |
| 技能生态 | 13000+技能(ClawHub市场) | 自动生成+手动安装 | 手动开发+社区贡献 |
| 平台集成 | 24+平台(含微信/飞书/钉钉) | 20+平台 | 15+平台 |
| 记忆系统 | 明文Markdown(高透明度) | 三层架构+FTS5+向量库 | 数据库+向量库 |
| 最低硬件 | 2核4G | 2核4G | 4核8G |
| 部署难度 | 简单(Docker一键部署) | 中等 | 复杂 |
| 开源协议 | MIT(商业友好) | 开源 | 开源 |
| 社区规模 | 180K+ stars | 增长中 | 较小 |
| 小公司适用性 | 强烈推荐 | 可选 | 偏重 |
对于小公司,OpenClaw是最佳选择。其Gateway架构天然适配"IM作为入口"的需求,13000+现成技能覆盖大部分常见场景,2核4G即可部署,MIT协议商业友好。Hermes适合需要"越用越聪明"的长期个性化场景,Harness适合大型企业复杂多Agent协同。
2.2 执行引擎:Claude Code
在Claude Code、Codex、Cursor三大AI编程工具中,我们选择Claude Code作为唯一执行引擎[4]:
| 维度 | Claude Code(推荐) | Codex | Cursor |
|---|---|---|---|
| 运行环境 | 终端原生 | 终端/API | IDE(VSCode重构) |
| 上下文窗口 | 200K/1M | 中等 | 中等 |
| 工作流 | Explore→Plan→Implement→Commit | 并行快速 | 实时交互 |
| 计费模式 | 按量付费 | 按量 | $60/月固定 |
| MCP支持 | 原生支持 | 支持 | 支持 |
| 适合场景 | 复杂多步研发任务 | 批量独立子任务 | 需人工微调 |
| 小公司成本 | 灵活低门槛 | 适中 | 固定支出 |
选择Claude Code的核心理由:终端原生无需IDE开销、四阶段工作流完全匹配研发生命周期、200K/1M最大上下文窗口可理解大型代码库、按量付费模式对小公司更友好。
2.3 工具集成:MCP + Skills双轨制
MCP和Skills不是竞争关系,而是互补的上下层架构[5]:
| 维度 | MCP(Model Context Protocol) | Skills(技能知识库) |
|---|---|---|
| 解决的问题 | "怎么连"——底层通信协议 | "怎么做"——上层操作手册/SOP |
| 存储形式 | MCP Server进程(JSON-RPC通信) | SKILL.md文件(明文Markdown) |
| 生态规模 | 3000+ Server,月下载9700万次 | 可按需自定义,社区共享 |
| 典型场景 | 连接Git、数据库、云服务API | 封装"如何写PRD"、"如何做Code Review" |
三层架构形成清晰分层:
MCP在2026年迎来三大重要演进:Tasks模式支持长时间运行的任务编排,Sampling与Elicitation允许Agent在执行中主动向人类请求确认或补充信息,无状态传输降低Server端的持久化负担提升可扩展性。需要特别注意的是安全风险——2026年1-2月MCP生态暴露了30+个CVE漏洞,因此所有MCP Server必须在沙箱环境中运行,并配置最小权限原则。
2.4 交付平台:Harness CI/CD
Harness作为交付平台的核心优势在于Pipeline as Code的声明式设计——AI Agent可以自动生成YAML格式的流水线配置,无需人工编写[6]。主要能力覆盖四个维度:
- 声明式流水线:YAML定义CI/CD流程,Agent可直接生成和修改,实现"代码即Pipeline"
- Feature Flags灰度发布:新功能先对5%用户开放验证,确认无异常后全量发布,降低发布风险
- 自动回滚:基于Golden Signals(延迟、流量、错误率、饱和度)监控,异常时自动触发回滚
- AIDA智能模块:提供故障根因分析、智能金丝雀发布策略、自然语言生成Pipeline等AI增强能力
在测试优化方面,AIDA模块能分析代码变更的影响范围,智能选择需要运行的测试子集,实测可将测试时间缩短70%。这意味着Agent驱动的快速迭代不会因为测试环节成为瓶颈。
三、六层总体架构
AI-CDP平台采用六层架构设计,从用户交互到基础设施逐层解耦:
3.1 核心数据流
全链路形成闭环数据流,从用户输入到结果反馈完整贯通:
每个环节通过Redis Streams异步事件驱动,解耦上下游依赖,确保任一环节故障不会阻塞整个链路。
3.2 架构决策记录(ADR)
以下是平台设计过程中的四项关键架构决策:
| 决策 | 选择 | 替代方案 | 理由 |
|---|---|---|---|
| 消息通信 | Redis Streams | Kafka / RabbitMQ | Consumer Group保证可靠投递,2核4G可用,运维成本极低 |
| 工具协议 | MCP标准 | 自研REST封装 | N×M集成问题一次解决,3000+现成Server生态 |
| 执行引擎 | 单引擎Claude Code | 多引擎混合 | 按量付费降低成本,单一引擎降低切换与调试成本 |
| 部署方式 | Docker Compose起步 | K8s集群 | 2核4G最低门槛,小团队可快速启动,后续可迁移 |
四、控制中心:OpenClaw 网关与技能引擎
OpenClaw采用Gateway网关架构,四大核心子系统协同工作:
四大子系统职责:
- Channel Adapters:统一接入飞书/企微/钉钉/Webhook等多平台消息,协议适配层
- Gateway:统一入口路由,消息分发,会话管理,权限校验
- Skill Engine:技能注册/发现/调度,根据用户意图匹配最优Skill执行
- Memory:明文Markdown存储(soul.md人格设定、memory.md记忆、user.md用户画像),可直接编辑、高透明度
- Sandbox:有状态隔离执行环境,Agent在沙箱内安全执行代码操作
技能体系设计
基于OpenClaw的SKILL.md标准,设计六大研发技能,覆盖完整研发生命周期:
六个技能以SKILL.md文件形式存储,每个文件包含技能描述、输入输出规范、执行步骤和验收标准。Skills通过OpenClaw Skill Engine注册后,由Gateway根据用户需求自动匹配和调度。
多Agent协作模式
OpenClaw的Gateway架构支持多会话并行。在研发场景中,采用层级型编排模式:用户通过飞书发送需求 → Gateway路由到Explore Skill进行代码库分析 → 生成建议需求后推送确认卡片(HITL暂停)→ 用户确认后调度Claude Code执行Plan→Implement → 完成后触发Test Skill验证 → 测试通过则触发Deploy Skill部署 → 最终推送验收卡片。
当测试失败时,系统自动回滚修复:OpenClaw收到测试失败事件后,暂停部署流程,推送失败报告到飞书,同时调度Claude Code回滚代码变更并重新修复。
五、用户交互入口:IM集成与移动端卡片
5.1 IM平台集成
OpenClaw原生支持24+平台集成,包括飞书、企业微信、钉钉等国内主流IM。集成方式通过Channel Adapter实现统一接入:
| 平台 | 接入方式 | 消息格式 | 交互回调 |
|---|---|---|---|
| 飞书 | 自定义机器人 + Webhook | 卡片消息JSON | 卡片按钮回调 |
| 企业微信 | 应用消息 + Webhook | 文本/Markdown卡片 | 交互回调URL |
| 钉钉 | Stream模式 + Webhook | ActionCard | 卡片回调 |
5.2 移动端进度卡片设计
采用异步进度通知卡片,使用三态状态图标系统:
| 图标 | 状态 | 颜色 | 语义 |
|---|---|---|---|
| ✅ | Done(已完成) | 绿色 #22c55e | 步骤已完成,有产出物 |
| 🔄 | InProgress(进行中) | 蓝色 #3b82f6 | 正在执行,带旋转动画 |
| • | Pending(待定) | 灰色 #d1d5db | 尚未开始,弱化处理 |
卡片采用异步通知而非实时进度条,适合执行时间不确定的后台任务。Agent主动推送状态变更,用户无需等待。确认类型分为三种:确认类(批准/拒绝)、选择类(多选项技术方案)、输入类(补充信息澄清)。
5.3 Webhook回调机制
用户在飞书卡片上点击按钮后,飞书通过Webhook回调通知OpenClaw。回调结构包含action.type(confirm/modify/reject)、task_id、step等字段。OpenClaw解析后:confirm→继续下一步,modify→暂停等待用户补充输入,reject→回滚到上一Checkpoint。
六、研发执行引擎:Claude Code 四阶段工作流
Claude Code的Explore→Plan→Implement→Commit四阶段工作流,完全匹配研发生命周期[6]:
推理强度支持六个等级:low / medium / high / xhigh / max / ultracode,从快速响应到深度推理覆盖不同场景需求。并行能力方面,batch模式可将独立任务拆分到不同worktree并行执行,fork模式启动后台子代理,loop模式设置定时周期任务。
上下文窗口管理
Claude Code支持200K/1M token上下文窗口,对于小公司项目通常足够。关键策略:
- Explore阶段:使用200K窗口分析整个模块,理解架构全貌
- Plan阶段:将探索结果压缩为方案文档,减少上下文占用
- Implement阶段:聚焦当前任务文件,保持上下文精简
- 记忆持久化:通过OpenClaw的memory.md保存跨会话上下文
OpenClaw的Dev Skill通过CLI方式调度Claude Code,每个阶段通过--mode参数控制行为。Plan和Commit阶段自动触发HITL暂停,推送飞书卡片等待用户确认。
七、人机协同:80%自主 + 4个HITL关键门控
AI-CDP平台的核心设计哲学是"80% Agent自主推进 + 4个HITL关键门控"。Agent负责80%的重复性、确定性工作(代码探索、文档生成、编码实现、测试执行),人类只在4个关键决策点介入审核。这既保证了效率,又将最重要的决策权保留给人类[7]。
四个门控的触发时机和确认内容:
- 门控1:需求确认(Explore完成后)——确认需求是否准确,未确定事项是否已澄清
- 门控2:PRD审核(Plan完成后)——确认方案是否合理,技术选型是否正确
- 门控3:计划审查(任务拆解完成后)——确认任务拆分是否合理,依赖关系是否正确
- 门控4:部署验收(预发部署完成后)——确认功能是否满足需求,是否可以上线
Checkpoint状态机
每次HITL暂停时,系统自动保存完整的Checkpoint快照,包括:当前任务上下文、已完成步骤清单、所有中间产物(PRD文档、方案设计、代码变更)、完整的工具调用历史。这确保即使审批延迟数小时甚至数天,恢复执行时不会丢失任何上下文。
状态流转:Idle → Exploring → HITL_Paused → Checkpoint_Saved → Approved → Implementing → Completed。若用户拒绝则回滚到上一Checkpoint;若执行异常则自动回滚。
故障恢复四重保障
| 保障层级 | 机制 | 触发条件 | 恢复方式 |
|---|---|---|---|
| L1 | Checkpoint恢复 | 会话中断/超时 | 从最近快照恢复,重放未完成步骤 |
| L2 | Fallback策略 | Agent执行失败 | 降级到备选方案或拆分任务重试 |
| L3 | Validation Loop | 输出质量不达标 | 自动重新执行,最多3轮自修正 |
| L4 | HITL升级 | 连续3轮自修正失败 | 暂停自动执行,升级为人工处理 |
HITL行业最佳实践:根据2026年多项实证研究,在关键决策点引入HITL审核可将AI回答错误率从15%降至3%以内,同时将人工工作量从100%降至30%。这意味着人类工程师的角色从"执行者"转变为"审核者",效率提升3-5倍。
质量阈值动态管理:平台支持根据业务节奏动态调整质量阈值——业务高峰期(如大促期间)阈值降至0.6以加速交付,低峰期升至0.7确保质量,新业务首次上线时降至0.5以降低试错成本。
八、事件驱动与可观测性
AI-CDP平台采用Redis Streams作为轻量级事件总线,替代传统Kafka方案。选择Redis Streams的核心考量:2核4G环境下即可稳定运行,Consumer Group机制保证消息至少一次投递,运维复杂度极低。
系统定义四个核心事件Topic:
HITL门控触发/审批/驳回
Checkpoint保存/恢复
测试执行/覆盖率报告
安全扫描结果
Feature Flags切换
灰度进度/全量发布
异常检测/趋势预警
Agent故障升级
消息可靠性四重保障:Consumer Group至少一次投递 + 幂等消费者设计(去重表) + DLQ死信队列(处理失败消息) + AOF持久化(防止Redis宕机丢消息)。
Golden Signals 与三大支柱
Golden Signals四大信号构成监控基线:
| 信号 | 指标 | 告警阈值 | 触发动作 |
|---|---|---|---|
| 延迟 | P99响应时间 | > 基线2倍 | 自动扩容 + P1告警 |
| 流量 | QPS请求量 | > 容量80% | 限流 + 预扩容 |
| 错误率 | 5xx错误百分比 | > 1% | 自动回滚 + P0告警 |
| 饱和度 | CPU/内存使用率 | > 85% | 弹性扩容 + P1告警 |
三大可观测性支柱协同工作:Metrics(Prometheus + Grafana)负责指标采集与可视化,Tracing(OpenTelemetry + Jaeger)负责全链路追踪,Logging(Loki + 结构化日志)负责日志聚合与检索。
Agent专属指标与告警
除了传统APM指标外,平台还监控Agent专属指标:
- 任务完成率:成功完成的任务/总任务,目标 >95%
- Agent响应延迟:从触发到响应的延迟分布,P99 <30s
- 工具调用成功率:MCP工具调用成功/总调用,目标 >98%
- Token消耗趋势:每日/周Token消耗量,日消耗 >预算120%告警
- Checkpoint恢复次数:24h内 >3次告警
- HITL平均确认时长:>2h提醒
告警三级路由机制确保不同严重程度的问题得到适当响应:
- P0(紧急):电话通知 + 飞书紧急卡片,5分钟内响应。触发条件:错误率>5%或服务完全不可用
- P1(重要):飞书卡片告警,30分钟内响应。触发条件:P99延迟超阈值或饱和度>90%
- P2(一般):邮件通知,4小时内响应。触发条件:Agent成功率下降或Token消耗异常
九、部署与成本:小公司的落地路径
整套平台以Docker Compose方式部署,7个容器即可运行全部功能:
docker-compose.yml核心结构包含:services定义各容器服务,networks自定义bridge网络实现服务间隔离通信,volumes持久化数据卷保存状态,environment通过.env文件注入API密钥等敏感配置。docker compose up -d即可一键启动,15分钟内完成搭建。
从Docker Compose到K8s的演进
当团队规模增长或需要高可用时,可迁移至Kubernetes集群。K8s通过Deployment声明副本数和滚动更新策略,Service提供稳定的服务发现入口,Ingress统一对外暴露HTTP路由,ConfigMap/Secret分离管理配置和敏感信息,HPA根据CPU/内存指标自动扩缩容。
迁移路径:将compose服务映射为K8s Deployment,数据卷映射为PersistentVolumeClaim,网络映射为Service+Ingress。建议3节点集群起步(1 Master + 2 Worker)。初期用Docker Compose单机部署快速验证业务价值;当团队超过10人或日任务量超过50个时,迁移到K8s多节点集群。
月成本估算
| 费用项 | 最低配置 | 标准配置 | 说明 |
|---|---|---|---|
| 云服务器(2C4G) | ¥200/月 | ¥200/月 | 阿里云/腾讯云轻量级 |
| Claude Code API | ¥500/月 | ¥2000/月 | 按Token用量计费,与任务量正相关 |
| OpenClaw | 免费 | 免费 | MIT协议开源 |
| Harness CI/CD | 免费 | 免费 | 免费版支持基础CI/CD |
| 月度总计 | ¥700/月 | ¥2,200/月 |
以一个5人技术团队为例,AI-CDP平台可替代1-2名中级开发工程师的重复性编码与部署工作,年化节约人力成本30-60万元,投入产出比(ROI)达到5-10倍。
四阶段实施计划
风险评估与应对
| 风险 | 影响 | 应对措施 |
|---|---|---|
| Agent幻觉 | 生成错误代码或方案 | HITL四门控确认 + 自动测试验证 + 代码审查Skill |
| 工具调用安全 | 误操作生产环境 | 沙箱隔离 + 权限矩阵 + 敏感操作二次确认 |
| Token成本失控 | API费用超预算 | Token消耗监控 + 日预算限制 + 上下文窗口管理 |
| 飞书API限制 | 消息推送频率受限 | 消息合并推送 + 异步通知模式 + 限流策略 |
| 单点故障 | 单机部署服务不可用 | Checkpoint恢复 + Docker重启策略 + 定期备份 |
十、写在最后
AI编程的核心挑战从来不是"Agent写代码的能力"——2026年的Claude Code已经能很好地完成编码工作。真正的挑战在于"谁有权力审批Agent的产出"。
这本质上是一个组织治理问题,而非技术问题。一个未经审核的Agent PR可能导致生产事故,而一个过度保守的审批流程又会让AI自动化的效率优势荡然无存。AI-CDP平台的"80%自主 + 4个HITL门控"设计,正是对这一矛盾的技术化回应。
随着平台成熟,工程师的角色将发生根本性转变:从亲手编写每一行代码的"编码者",转变为制定规范、审核产出的"规范制定者 + 质量审核者"。这并不意味着工程师的价值降低——恰恰相反,能在更高抽象层面把控系统质量和方向的工程师,其价值将远超纯粹的编码执行者。
最后,这套方案的真正意义在于:小公司也能以极低成本享受到AI自动化的红利。月费不足3000元、2核4G即可起步的部署方案,让AI-CDP不再是大型企业的专属。2026年的成熟工具链(OpenClaw + Claude Code + MCP + Harness)已经为小团队的低成本自动化铺好了路,关键在于是否能率先迈出第一步。
参考资料
- 2026 AI技术栈全解读:从单体大模型到数字员工集群的演进 http://m.toutiao.com/group/7631485645285884422/
- MCP协议实战:2026年Agent工具调用标配,3000+开源Server http://m.toutiao.com/group/7655974154096656915/
- Harness vs OpenClaw vs Hermes 全方位深度对比分析 https://toutiao.com/group/7638820756394230324/
- 2026年AI编程三巨头实测:Claude Code/Codex/Cursor开发者选型指南 http://m.toutiao.com/group/7659669666054390318/
- Agent Skills与MCP协议的区别与协同:三层架构Agent+Skills+MCP https://blog.csdn.net/2501_92397792/article/details/156983176
- Claude Code深度使用与进阶:Explore→Plan→Implement→Commit四阶段工作流 https://blog.csdn.net/qq_63358859/article/details/161978980
- Human-in-the-Loop设计模式:Agent关键步骤暂停等待人类确认 http://m.toutiao.com/group/7578147423088837155/