开发16 分钟

AI 技术栈演进 2025 到 2026:从提示词工程到运行系统工程

很多人的认知还停在「写好提示词」,少数人停在「接好 MCP」,而行业已经走到第三阶段。一句话主线:能力正从模型里溢出,流到模型外面的那层系统上。模型能力在快速商品化,差异化的位置持续外移,从提示词到上下文,再到围绕模型的整套运行系统。谁掌握外面那层,谁就掌握产出质量。

主线:19 个月里的三次范式转移

这不是一个自造的说法,是行业的共识表述。2025 年 6 月第三周,Shopify CEO Tobi Lütke 在 X 上点起了 context engineering 这个词,一周内 Karpathy、吴恩达和大批工程师跟进,prompt engineering 开始从时间线上消失。到 2026 年,关键指标已经不是提示词质量,而是 KV 缓存命中率和运行系统的复杂度。

阶段时间核心问题关键动作失败原因
提示词工程2022 到 2024我该怎么说写好 prompt、few shot单轮有效,多步就崩
上下文工程2025我该给什么信息RAG、记忆、上下文窗口管理信息给对了,系统仍然不稳
运行系统工程(Harness)2026我该造什么系统循环、压缩、子代理、沙箱、钩子、评测正在进行中

学术界对这个演进的拆解更细:提示词工程优化的是静态文本输入;上下文工程把可优化面扩展到检索文档、记忆缓冲和动态构造的输入;运行系统工程则把提示、工具、记忆、校验规则、编排逻辑、运行时机制当成一个统一的优化对象,再往上是让系统观察自己的行为、发现失败并自动调整的闭环工程。

判断你在哪一层:如果团队里还有人认为「AI 用不好是提示词没写对」,这个认知落后了大约两年。

时间线:2025 上半年,推理能力商品化

1 月 DeepSeek R1 发布,用 GRPO 在极低成本下达到 o1 水平,中国开源社区第一次在推理方向上取得领先位置。3 月 25 日 Google 发布 Gemini 2.5 Pro Experimental,其第一个显式思维链的思考模型。5 月 22 日 Anthropic 发布 Claude 4 系列,同时发布 Claude Code,一个命令行形态的自主编码 agent。

这半年的意义在于:推理不再是稀缺能力。差异化开始从「模型会不会想」转向「能不能可靠地干活」。

时间线:2025 下半年,Agent 产品化

8 月 GPT-5 发布,把通用能力和推理能力合成一个系统,由路由器自动在快答和深度工具调用之间切换。o 系列品牌被并入 GPT-5,推理从独立模型家族变成一种模式。同期 Codex 从开源 CLI(2025 年 4 月)走到 ChatGPT 里的云端软件工程 agent(5 月),10 月正式可用。

Claude Code 在这半年成为最有代表性的产品:到 2025 年底占公开 GitHub 提交的 4%,上线六个月做到 10 亿美元年化,速度超过 ChatGPT 当年。

年末的模型密集期:11 月 17 日 Grok 4.1、11 月 18 日 Gemini 3、11 月 24 日 Claude Opus 4.5(SWE-bench Verified 80.9%)、12 月 11 日 GPT-5.2,二十几天内四家发布各自最强模型。

时间线:2025 年末,标准化与治理

这三个月定下了今天技术栈的骨架,是整段演进里最关键的三个月。

10 月 16 日,Anthropic 发布 Agent Skills,最初定位很低调,只是提升 Claude 在特定任务上的表现,但很快被行业普遍采用。

12 月 9 日,Anthropic 把 MCP 捐给 Linux 基金会下的 Agentic AI Foundation,OpenAI 和 Block 作为联合创始成员,AWS、Google、微软、Cloudflare、GitHub、Bloomberg 加入。同批进入基金会的还有 goose 和 AGENTS.md。

12 月 18 日,Agent Skills 作为独立开放标准发布在 agentskills.io,同时上线企业技能管理层和合作伙伴技能目录(Atlassian、Canva、Cloudflare、Figma、Notion、Ramp、Stripe、Zapier)。12 月 18 日至 20 日,微软(VS Code / Copilot)和 OpenAI(ChatGPT、Codex CLI)在 48 小时内跟进支持。

一个格式在 48 小时内被最大的两个竞争对手采用,这在软件史上很罕见。 原因是它足够简单:一个文件夹加一个 SKILL.md。

时间线:2026 上半年,个人 Agent 爆发与节奏碎片化

个人 agent 破圈。奥地利工程师 Peter Steinberger 在 2025 年底做出的 OpenClaw,三个月冲到 GitHub 历史上 star 数最高的可运行软件,创始人被 Sam Altman 挖进 OpenAI,项目随即移交基金会独立运作。围绕它的社区活动 ClawCon 从旧金山办到纽约、迈阿密、奥斯汀、马斯垂、东京,5 月落地上海。架构上它是 Gateway 作为常驻控制面负责通道接入与会话编排,Agent 负责任务分解与工具调用循环,Skills 以技能包和注册中心扩展能力边界。

学术上的评价是:OpenClaw 在 2026 年初的崛起,标志着数百万普通用户开始把个人 AI agent 部署进日常生活,也标志着 AI 工程从提示词和上下文工程转向运行系统工程这个拐点。

发布节奏碎片化。OpenAI 从 GPT-5.3-Codex 走到 5.4、5.5、5.6,Anthropic 走过 Opus 4.6、4.7、4.8,Google 从 Gemini 3.1 迭代到 3.5、3.6。有效的分析单位不再是年度「代际」,而是特定工作负载上的能力、价格、延迟曲线。

模型开始受地缘政治约束。Anthropic 在 6 月 9 日发布 Mythos 级别的 Fable 5,6 月 12 日因美国商务部出口管制暂停访问,6 月 30 日管制解除,7 月 1 日恢复。对使用方的教训很直接:如果工作流焊死在「最新的那个 Claude」上,两周内会依次遇到目标漂移、你没选择的回退模型、以及模型消失。

当期状态。7 月 24 日 Claude Opus 5 发布,在 Artificial Analysis 的智能指数(61)和 Agentic 指数(55.3)上排第一,价格为每百万 token 输入 5 美元输出 25 美元。7 月 8 日至 9 日四家连发:GPT-5.6 系列(Sol、Terra、Luna)正式可用并成为 ChatGPT 默认,xAI 的 Grok 4.5,Meta 的 Muse Spark 1.1,字节的 Seedream 5.0 Pro。

协议大改。MCP 2026-07-28 规范在 7 月 28 日正式发布,是发布以来最大的一次修订:无状态核心、响应缓存、扩展框架、MCP Apps、重新设计的 Tasks、正式弃用政策,替代 2025-11-25 版。

产业情绪。2026 年 6 月,产业进入从「模型竞赛」走向「商业验证」的阶段。路透报道超大云厂商 2026 年资本开支预计超过 8000 亿美元,同时国际清算银行警示 AI 投资热潮可能带来金融不稳定。达沃斯今年的讨论重心也从概念能力转向了投入能否转化为绩效。

技术栈分层:六层地图

这是整份材料的核心。把下面六层当成一张地图,任何一个新工具、新名词出现时,先问它属于哪一层。

第一层:模型。 选型逻辑已经变了,不再是「哪个最强」,而是针对具体任务看能力、价格、延迟三条曲线。实践建议:任何时候不要只接一家,接口层做抽象,模型可换。

第二层:上下文。 三个关键概念。一是上下文税,一个 Claude Code 会话在你说第一句话之前,可能已经有 24% 以上的上下文被 MCP 工具定义占掉,Anthropic 在 2026 年 1 月上线 MCP Tool Search,当工具定义超过 10% 上下文时改为按需加载。二是渐进披露,只预载名称和描述,任务匹配时才加载完整指令,这是 Skills 的核心设计。三是上下文质量优先于容量,真正的瓶颈不是上下文体积而是上下文质量,过期的上下文比没有上下文更糟,因为 agent 会拿昨天的文档自信地行动,错得像是推理正确。

第三层:能力接入(MCP)。 MCP 解决的是「agent 怎么连到外部工具」,把 N×M 的接线问题变成标准接口。它不解决的是「该怎么做这件事」。这个错配已经引发公开反弹:Perplexity 的 CTO 在 ASK 2026 上说公司内部在降低 MCP 优先级,YC 的 Garry Tan 跟着说 MCP 吃上下文、认证是坏的,他半小时写了个 CLI 替代品。判断标准:跨客户端复用、需要标准发现机制,用 MCP;只在本机跑、只自己用,CLI 加 Skills 更划算。

第四层:流程封装(Skills)。 MCP 给的是访问权,不是方法。它告诉你「这是连 Slack 的方式和你能做什么」,不告诉你「写状态更新时先从这三个频道取数、按这个格式总结、发布前要审批」。后者是 Skills 的职责。生态现状:到 2026 年 6 月,agentskills.io 官方展示页约有 40 个兼容产品,包括 OpenAI Codex、GitHub Copilot、Cursor、Gemini CLI 和 VS Code。社区目录规模巨大,SkillsMP 一家就索引了约 190 万个从 GitHub 抓取的公开 skill。但数量不等于质量:SkillsBench 分析了 47,150 个公开 skill,平均质量分只有 12 分制的 6.2 分;而经过筛选的优质 skill 能让 agent 通过率平均提升 16.2 个百分点。

第五层:运行系统(Harness)。 这是 2026 年真正的差异化战场,也是大多数人还没意识到的一层。公式是 Agent = 模型 + 运行系统。展开讲在下一节。

第六层:协作与交易。 A2A(agent 之间)一年内从 50 个合作方长到 150 多个组织,IBM 自己的 ACP 在 2025 年 8 月并入 A2A,对今天设计 agent 间集成的人来说基本没有 A2A 之外的选项。交易层还没定:ACP(OpenAI 加 Stripe)负责结账握手,AP2(Google,v0.2 已于 2026 年 4 月 28 日捐给 FIDO 联盟)负责证明支付授权,二者是不同层不是竞品。Visa 在 4 月 8 日上了协议无关的接入层,同时接受 TAP、MPP、ACP、UCP 多种标准。连卡组织都不敢押单一赢家,说明这一层远未收敛。热度量级参考 GitHub star 数:MCP 约 87,000,A2A 约 24,000,UCP 约 3,107,ACP 约 1,439。下面两层已定,上面还在打。

运行系统(Harness)的六个核心组件

压缩(Compaction)。 上下文快满时必须有东西被丢掉。对 Claude Code 架构的逆向分析显示它有五级渐进压缩:预算削减、剪枝、微压缩、上下文塌缩、自动压缩。关键教训是不要指望压缩保住关键规则,压缩会保留当前任务、近期错误和文件名,但会丢掉初始指令、中间决策和风格规则。关键规则要放进 CLAUDE.md,它活在系统提示里,任何压缩都动不了它。

子代理隔离。 上下文被污染时,开一个干净的子代理去做,权限受控、上下文重建。

钩子(Hooks)。 Claude Code 有 27 种事件类型的钩子管线。典型用法:拦截模型试图退出的动作,把原始任务重新注入一个全新的上下文窗口,逼它继续做到完成目标为止。

沙箱。 agent 要跑代码验证自己的输出,但不能和自己跑在同一个进程或容器里。生产级方案是 Docker、临时虚拟机或 WebAssembly 运行时。

文件系统即上下文。 不要把所有东西塞进提示词,而是暴露成文件让 agent 按需读取。这是微软 SRE agent 迁移得到的核心经验。

规则的纪律。 Hashimoto 法则:AGENTS.md 里的每一行都必须能追溯到一次真实的 agent 失败,如果指不出是哪次错误催生了这行,就删掉。零条愿望式规则。还有信息对等原则:如果某个信息人能拿到而 agent 拿不到,那是运行系统的漏洞。你读过的每份文档、你「就是知道」的每个惯例,都要编码进运行系统,否则 agent 会犯人不会犯的错。

当前长任务的三个已知短板:过早停止、复杂问题分解不良、跨多个上下文窗口后的不连贯。运行系统必须围绕这三点来设计。

六个公认还没解决的问题

  1. 上下文税。 工具搜索和渐进披露是缓解,不是解决。
  2. 安全边界塌缩。 Skills 把自然语言指令和可执行脚本放进同一个文件系统包,等于拆掉了「能力说明」和「代码执行」之间的界线,安全代价比它的两个前身都严重。
  3. 长任务不连贯。 压缩本身不足以支撑长任务,有时必须用一份结构化简报重新开始,更接近给新同事做交接而不是我们通常理解的「记忆」。
  4. 记忆语义不统一。 一项 2026 年的研究显示,运行时的持久化模式如果和模型训练时的语义不匹配,会产生 80% 的变量缺失错误或 3.5 倍的 token 开销。
  5. 扩展碎片化。 企业需求(审计、SSO、网关、配置可移植)全部以扩展形式落地,未来 12 到 18 个月很可能出现针对同一件事的竞争扩展轨道,绑死单一客户端的扩展栈需要自担迁移成本。
  6. 投入产出未验证。 达沃斯和监管机构都已经把问题从「能不能做到」换成了「能不能兑现」。

未来 12 到 18 个月的判断

  1. 分层固化。 MCP 管纵向(agent 到工具),A2A 管横向(agent 到 agent),交易层继续混战。这个骨架短期不会变。
  2. 重心继续外移。 模型能力趋同的速度快于运行系统能力扩散的速度,所以差异化会更集中在运行系统层。
  3. 形态从「问一句」变成「托付一件事」。 无状态核心加 Tasks 扩展意味着长任务和后台 agent 成为一等公民。
  4. 作者门槛消失。 Skills 只是 markdown,业务专家可以直接写,工程师负责评审和部署。这对小团队是纯利好。
  5. 发布节奏不会稳定。 把工作流焊死在任何单一模型上,都会周期性付出重建成本。

落到实操:该做与不该做

该做的:

  • 把关键规则写进 CLAUDE.md 或 AGENTS.md,不要指望它们在压缩后还活着。
  • 每加一条规则,都要能指出是哪一次真实失败催生的。
  • 内部知识做成索引加按需加载,不要整包塞进提示词。
  • 工具尽量薄,流程写进 skill,而不是把流程编码进工具。
  • 接口层对模型做抽象,任何时候不绑死单一供应商。
  • 优先用 markdown 和 CLI,能不写 server 就不写;非写不可就写无状态 HTTP。

不该做的:

  • 不要把产品建在协议形态上。协议每六到十二个月换一轮,产品的资产必须是数据、责任或受众三者之一。
  • 不要抄公开 skill 目录,平均质量不达标,收益来自我们自己的真实流程。
  • 不要在还没有评测的情况下扩大 agent 的自动化范围。没有评测的自动化是在放大错误率。

对一人公司来说,这一节最有价值的判断是第四条和第六条:Skills 把「把专业流程变成可复用能力」的门槛降到了会写 markdown,而运行系统这一层的差异化,恰恰是一个人靠积累就能建立起来的护城河。

术语对照表

术语一句话解释
MCPagent 连外部工具的标准接口
Skills / SKILL.md用 markdown 打包的可复用流程,按需加载
AGENTS.md / CLAUDE.md项目级的常驻规则文件,活在系统提示里
Harness模型之外的整套运行系统,2026 年的主战场
Compaction上下文快满时的自动压缩,会丢失初始指令
Subagent隔离上下文的子代理,防污染
Hook在 agent 生命周期事件上挂载的拦截逻辑
渐进披露先只加载名称和描述,命中才加载全文
A2Aagent 之间通信的标准
ACP / AP2 / UCP交易层协议,分别管结账、支付授权、全流程

完整版 PDF 收录了更细的关键日期速查表(从 2025.01 DeepSeek R1 到 2026.07.28 MCP 新规范共 16 个节点),适合打印出来贴在手边。

常见问题

MCP 和 Agent Skills 是竞争关系吗?该选哪个?

不是竞争关系,它们在不同层。MCP 解决「agent 怎么连到外部工具」,给的是访问权;Skills 解决「该怎么做这件事」,给的是方法。判断标准:跨客户端复用、需要标准发现机制,用 MCP;只在本机跑、只自己用,CLI 加 Skills 通常更省上下文也更灵活。

什么是运行系统工程(Harness),和上下文工程有什么区别?

上下文工程优化的是「喂给模型什么信息」,运行系统工程把提示、工具、记忆、校验规则、编排逻辑和运行时机制当成一个统一的优化对象,再往上是让系统观察自身行为、发现失败并自动调整。公式是 Agent = 模型 + 运行系统,2026 年的差异化主要在后半部分。

为什么说「关键规则要写进 CLAUDE.md」?

因为上下文压缩会丢东西。压缩通常保留当前任务、近期错误和文件名,但会丢掉初始指令、中间决策和风格规则。CLAUDE.md 或 AGENTS.md 活在系统提示里,任何压缩都动不了它,所以真正不能丢的规则要放那儿。

一个人做产品,这套技术栈里最该投入哪一层?

运行系统层,以及把自己的真实流程写成 skill。模型能力在快速商品化且随时可能换代,绑死单一模型会周期性付出重建成本;而围绕模型的那层系统是可以靠积累沉淀的资产,也是小团队少数能建立护城河的位置。

这份材料的数据截止到什么时候?还准确吗?

数据截至 2026 年 8 月 1 日。协议和模型版本变动频繁,MCP 规范在 2026 年 7 月 28 日刚做过一次大改,模型发布节奏是以月为单位的。超过三个月建议重新核对具体版本号和价格,但六层技术栈的骨架和三次范式转移的主线是稳定的。