AI 工程:从提示词到循环工程的五次跃迁
提示词、提示词工程、上下文工程、Harness、循环工程——这不是五个并列的技术名词,
而是一条清晰的进化链:模型越强、任务越长,"驾驭 AI"的工程抽象层级就越往上抬。
本文拆解 2025–2026 年业界最新实战理念,看懂每一次跃迁为何必然发生。
进化全景:驾驭抽象层级的五次抬升
先用一张图建立全局认知。下图中每一个节点都解决前一层的痛点,又暴露出新的问题,于是催生下一层。读懂这条链,就读懂了过去三年 AI 工程的全部主线。
一句话主线:模型变强,并不会让"工程"消失——它只会把工程的重心从"驯服单次输出"不断上移到"设计自主运转的系统"。你驾驭的抽象层级越高,单点技巧的边际收益就越低,系统设计的杠杆就越大。
1第 1 重 · 提示词 Prompt —— 一切的起点
提示词(Prompt)是你喂给模型的原始输入文本。在模型眼里,你的话不是"中文句子",而是先被分词器切成一个个 token(词元),再变成向量,再送进 Transformer。提示词是一切 AI 工程的最小单元——就像源代码里的一个字符。
提示词是一次性的、单点的、无状态的。你每次发问,模型都从零开始读你的输入;上一轮说过的话(在没有记忆机制时)它全忘了。对于"一问一答"的聊天,这够了;但一旦任务需要多轮推进、需要记住中间结果,单点提示词立刻捉襟见肘——于是催生了提示词工程。
2第 2 重 · 提示词工程 Prompt Engineering —— 把一句话写好
提示词工程(Prompt Engineering)是编写和组织 LLM 指令以获得最佳结果的方法。它的核心战场是系统提示词(System Prompt)——那串在最开头、定义模型角色与规则的长文本。过去三年,业界沉淀出几条几乎万能的核心技巧。
🎯 系统提示词
📝 少样本示例
🧠 思维链
🎭 角色设定
这些技巧依然有用,但边际收益正在递减。原因有二:① 前沿模型(Claude 4 / GPT-5)本身已很强,"写好一句提示"带来的提升不再决定性;② 真实任务早已不是"一问一答",而是 Agent 在循环里跑几十上百轮——这时问题不再是"这句话怎么写",而是"窗口里堆积的几百轮工具调用结果,模型该怎么消化"。提示词工程的视野,够不到这里。
提示词工程的边界:它只回答"如何写好一条指令",却假设模型窗口里只有这一条指令。当窗口里挤满了系统提示、工具定义、检索文档、历史消息时,"写好一句话"救不了被淹没的关键信息——这就是上下文工程要接管的地方。
3第 3 重 · 上下文工程 Context Engineering —— 2025 的范式转移
2025 年,Anthropic 给出了一个已被业界广泛采纳的定义:上下文工程是在 LLM 推理时,策划和维护"最优 token 集合"的一整套策略——它不仅包括提示词,还包括所有可能进入窗口的东西:工具定义、检索文档、消息历史、外部数据。它是提示词工程的自然延伸。
LLM 就像一种新的操作系统:模型是 CPU,上下文窗口是 RAM,是模型的工作内存。就像 RAM 容量有限,上下文窗口能承载的上下文来源也有限。正如操作系统负责调度什么进入 CPU 的 RAM,"上下文工程"扮演着类似的角色——用恰好正确的信息,填满上下文窗口以服务下一步。
3.1 为什么必须做:Context Rot(上下文腐烂)
"大海捞针"(needle-in-a-haystack)基准测试揭示了一个现象——上下文腐烂:随着上下文窗口里的 token 数量增加,模型准确召回其中信息的能力反而下降。原因有三:
① 注意力预算:上下文是有限资源,有递减的边际收益,每个新 token 都在消耗这个预算;
② n² 注意力关系:Transformer 让每个 token 关注所有其他 token,n 个 token 产生 n² 对关系,上下文越长,这些关系被拉得越薄;
③ 训练分布偏短:模型在训练中见过的短序列远多于长序列,对长程依赖缺乏专门参数。
因此,把上下文当宝贝、当有限资源来精打细算,是构建强 Agent 的前提。
3.2 上下文为什么会"坏掉":四种失败模式
Drew Breunig 在 2025 年系统总结了长上下文导致 Agent 性能下降的四种典型方式。理解它们,才知道上下文工程要解决什么。
一次幻觉混进了上下文,后续每一轮都把它当"既定事实"继续推理,错误像滚雪球一样累积放大。
无关信息淹没了训练信号。模型被海量 token 分散注意力,抓不住真正关键的那几条指令。
冗余的上下文干扰了响应。即便是"有用但多余"的信息,也会让模型在取舍间偏离最优解。
上下文的不同部分相互矛盾(如过时的旧指令与新指令打架),模型无所适从,行为变得不可预测。
3.3 四大策略:Write / Select / Compress / Isolate
LangChain 把业界应对手段归纳为四个动词。这是上下文工程的核心工具箱,几乎每一个强 Agent 都在用其中几种。
把上下文写到窗口之外
Agent 把信息存到窗口外,需要时再取。草稿本(Scratchpad):在任务进行中记笔记到文件或状态对象;记忆(Memory):跨会话持久化,如 Reflexion 的"反思记忆"、ChatGPT/Cursor 的长期记忆。
把上下文拉进窗口
从外部按需取回相关信息。读取草稿本、检索记忆、对工具描述做 RAG、对知识库做 RAG。代码 Agent 尤其典型:用 grep/文件搜索 + 知识图谱 + 重排序,精准取回相关代码。
只保留必需的 token
摘要(Summarization):用 LLM 蒸馏关键内容,如 Claude Code 在用到 95% 窗口时自动压缩(auto-compact)整段轨迹;裁剪(Trimming):按硬规则删旧消息、清掉已用完的工具调用结果。
把上下文拆分开
多 Agent:每个子 Agent 独占干净窗口,专攻子任务,只回传浓缩摘要;沙箱环境:把重 token 对象(图片/大数据)隔离在运行环境里;状态对象:用 schema 字段隔离信息,按需暴露给 LLM。
3.4 有效上下文的解剖:不只是"多",而是"精"
Anthropic 给出一条总原则:好的上下文工程,是找到最小的高信号 token 集,最大化达成目标的概率。这落到三个组件上:
系统提示要在两个极端之间找到金发姑娘区(Goldilocks Zone):一端是把复杂逻辑硬编码成脆弱的 if-else(维护噩梦、模型稍变就崩);另一端是给一句含糊的高层指导(模型拿不到具体信号、错误假设共享上下文)。最优解是具体到足以引导行为,又灵活到能提供强启发式。组织提示时用 <background> / ## Tool guidance 等分段 + XML/Markdown 标签切分。
工具定义了 Agent 与信息/动作空间的契约。两个常见病:① 工具返回的信息太啰嗦,浪费预算;② 功能重叠导致模型不知道该调哪个——"如果连人类工程师都说不清该用哪个工具,就别指望 AI 选对"。原则:自包含、健壮、用途极清晰,输入参数要发挥模型的长处。
很多团队往提示里塞一长串边界案例当规则。Anthropic 强烈建议反其道而行:精选一组多样、规范的范例来示范期望行为。对 LLM 而言,"一个好示例胜过千言万语"——示例是它最看得懂的"图"。
3.5 即时检索:Claude Code 的混合策略
传统的 RAG 是推理前一次性预检索所有相关数据塞进窗口。新趋势是 "即时"(just-in-time)策略:Agent 只在窗口里保留轻量标识符(文件路径、查询语句、网页链接),运行时用工具动态加载真正需要的数据。这模仿了人类——我们不背诵整个语料库,而是靠文件系统、收件箱、书签按需取用。
Claude Code 采用混合策略:CLAUDE.md 文件在启动时朴素地预载进上下文(提供项目规则),而 glob / grep 等原语让它即时导航环境、按需取文件。这样既绕过了"陈旧索引"问题,又不需要复杂的语法树。文件名、目录层级、时间戳本身就是元数据信号——一个叫 test_utils.py 的文件放在 tests/ 还是 src/core/,暗示着截然不同的用途。
3.6 长时程任务三件套
当任务跨越几十分钟到数小时(如大型代码库迁移、综合研究),token 量必然超过窗口。Anthropic 给出三把利器——注意,它们正对应上面四大策略的 Compress / Write / Isolate:
压缩 Compaction
结构化笔记
NOTES.md、todo list),稍后拉回。Claude 玩宝可梦是经典案例:它自动维护探索地图、记录招式克制关系,跨数小时训练保持连贯。子 Agent 架构
"上下文工程"……实际上是构建 AI Agent 的工程师的头号工作。
Agent 经常进行跨越数百轮的对话,需要谨慎的上下文管理策略。
上下文工程的跃迁意义:它把工程师的视野从"一句话"扩展到"模型在每一步看到的整个世界"。但请注意——它仍在回答"如何让单次推理更好"。当系统需要持续运行、自我纠错、协调多个 Agent、满足合规与安全时,单点优化不够了,必须上升为系统级框架。那就是 Harness。
4第 4 重 · Harness —— 从"管好一个请求"到"管好整个系统"
Harness(驾驭框架)是上下文工程的系统化与生产化。上下文工程关注"单次推理的 token 质量",Harness 则回答一个更硬的问题:当 AI 系统从实验室 demo 走向生产、从一段个人脚本变成影响千万人的服务,如何保证它可靠、安全、可控、合规?这是把 AI 从"能用"变成"敢用、可信"的那一层工程脚手架。
上下文工程解决了"单点最优",但生产系统是长跑:模型会更新、数据会漂移、攻击会进化、合规会收紧。Harness 把这些动态因素纳入一个闭环——监控 → 评估 → 防护 → 治理 → 反馈改进。它是上下文工程从"工艺"升级为"工程学科"的那一层脚手架。
4.0 同一个词的四层含义
"Harness"在不同语境下指向不同的东西——理解这四层,才不会把"工具""方法""架构""目标"混为一谈。
AI 开发 Harness
一套具体的工具链与平台,覆盖从提示管理、模型评估到部署监控的全生命周期。代表:LangSmith、Arize Phoenix、Langfuse。
AI 治理框架
一套系统性方法,确保 AI 在设计、训练、部署到退役的全生命周期中,始终符合人类价值观、法律规范与社会伦理。代表:NIST AI RMF、EU AI Act。
Agent 编排引擎
协调多个 Agent 协同工作的架构模式,解决"单个 Agent 能力有限"的问题。代表:LangGraph、AutoGen、CrewAI。
可信 AI
Harness 的终极目标——具备可靠性、安全性、公平性、透明性等特征的 AI 系统,才是真正值得信任的 AI。
4.1 为什么必须:AI 系统的五大独特风险
AI 越强大,风险越呈指数级增长。这些风险既不同于传统软件缺陷,也有别于信息安全领域的传统威胁——它们是模型原生的。
LLM 会生成看似合理、逻辑自洽却完全错误的内容。幻觉是模型的"原生日"——它本质是概率生成器,而非事实数据库。在 RAG 场景下,常表现为编造引用来源、曲解检索内容。
攻击者精心设计的提示词可绕过护栏诱导有害输出。Direct Injection(直接注入恶意指令)、Indirect Injection(经输入数据间接注入)、Jailbreak(角色扮演、多轮诱导)。研究显示仅约 55% 的 LLM 能在充分红队测试后保持 90%+ 防护率。
AI 会继承训练数据中的社会偏见,在性别、种族、年龄等维度产生不公平决策——嵌入在词汇偏好、推荐排序、识别准确率差异之中。
模型可能在生成时"遗忘"并复现训练数据里的隐私。成员推断攻击与模型反演攻击是两大核心威胁。
AI 在分布外(OOD)数据上行为往往不可预测——训练集上优异的模型,真实场景中可能因微小输入变化产生灾难性输出。对抗样本是最极端的案例。
强大的 AI 系统如果没有适当的治理框架,就像没有刹车的赛车——速度越快,危险越大。
4.2 四大支柱:可观测性 / 评估 / 防护 / 治理
业界共识:一个成熟的 AI Harness 应包含四大支柱,相辅相成,缺一不可。它们恰好构成一条从"看见 → 衡量 → 约束 → 合规"的完整闭环。
4.2.1 可观测性 — 看见看不见的
AI 系统的"内部思维"不可见,传统软件监控不够用——需要专门的技术来"看透"它的决策过程。
分布式追踪
结构化日志
指标面板
质量评分
🔑 趋势:2025–2026 年,可观测性正从"事后调试"升级为"实时质量感知"——新一代平台不仅能记录发生了什么,还能主动识别质量下降的早期信号。
4.2.2 评估 — 量化"智能"
评估是 Harness 的核心环节——没有评估,一切改进都是盲人摸象。2025 年起,AI 评估已发展为一门系统科学。
自动化基准测试
用 MMLU、GSM8K、HumanEval 等标准化基准测知识广度、数学推理、代码生成;新兴的 SWE-bench 直接测代码修复。但基准无法完全覆盖真实场景。
LLM-as-a-Judge
用更强的模型对输出质量自动打分。精心设计 Prompt 让 LLM 扮演评判者。已形成 AutoEval、Chatbot Arena 等成熟框架。
端到端场景测试
构建真实用户场景模拟完整工作流:客服 Agent 能否 5 轮内解决问题?RAG 能否答对专业问题?用 RAGAS、Giskard 评估召回率、忠实度等。
📐 RAG 系统专属评估指标
上下文召回率
上下文精确率
忠实度
答案相关性
4.2.3 防护 — 安全边界
防护机制确保 AI 在安全边界内运行,是最后一道防线,分输入、输出、访问、运行时四道关。
输入防护
输出防护
访问控制
运行时护栏
🛡️ 主流护栏框架
Guardrails.as
开源框架,通过控制器(Controllers)验证输入、提取输出。支持 JSON Schema 提取、格式校验、自定义验证逻辑,适合结构化输出场景。
NeMo Guardrails
NVIDIA 开源,用 SpeakZ DSL 定义对话流程与行为约束,支持多轮对话的受控生成,内置安全防护套件。
Microsoft Guidance
轻量级框架,支持 JSON Schema 引导、正则约束、提示模板复用,适合严格输出格式控制的场景。
Llama Guard
Meta 开源的内容安全护栏模型,专检不安全请求与输出,覆盖10 大类安全风险(暴力、仇恨等),支持多语言。
4.2.4 治理 — 制度保障
治理是 Harness 的顶层制度保障,确保 AI 在全生命周期中合规运行——技术之外,更是法规与组织流程。
美国 NIST 发布的 AI Risk Management Framework,全球最具影响力的治理框架之一。四大核心功能:治理(Govern)→ 映射(Map)→ 测量(Measure)→ 管理(Manage)。2023 年发布 1.0,持续更新落地指南。
2024 年通过,全球首部全面规范 AI 的法律。按风险分四级:不可接受(禁止,如社会评分)、高风险(医疗/司法/招聘,需严格合规)、有限风险(透明度要求)、最小风险。违规罚款最高达全球营收 7%。
大型企业普遍设立 AI 治理委员会审批高风险项目。关键实践:模型注册表、变更管理、审计追踪、偏见检测、人类监督——所有决策可追溯、可问责。
4.3 技术栈全景:2025–2026 工具选型
AI Harness 工具生态这两年爆发式增长。以下按四大支柱的功能维度给一张选型参考——不必全用,按风险与规模按需取用。
🔍 可观测性与追踪
LangSmith
Langfuse
Arize Phoenix
AgentOps
🧪 评估与测试
RAGAS
Giskard
红队工具
Garak(LLM 脆弱性扫描器)、Promptfoo,自动化识别模型的弱点和安全漏洞。🛡️ 安全防护
OpenAI Moderation API
DryIce
Guardrails.as
4.4 Agent 编排:Harness 在 Agent 时代的核心场景
单个 Agent 能力有限,复杂任务需要多个 Agent 协同——这就引出 Agent 编排(Orchestration),Harness 在 Agent 时代的核心应用,也是通向第 5 重"循环工程"的桥梁。
🔗 四种编排模式
流水线模式
Agent A → Agent B → Agent C,每个 Agent 负责一个阶段,顺序执行。最简单,适合流程清晰的任务。
路由模式
Router Agent 根据输入类型,选择最适合的专用 Agent处理。像调度员,把请求分到对口专家。
协作模式
多个 Agent 并行工作、共享上下文、互相调用工具,最终综合结果。适合需要多视角融合的任务。
层级模式
Manager Agent 拆解任务并分发给 Worker Agent,最后汇总。正是第 5 重"Fleet Loops"的雏形。
🤖 主流编排框架
LangGraph
AutoGen
CrewAI
🔑 趋势:Agent 编排正从"硬编码流程"走向"动态推理"。新一代框架(LangGraph 的 Checkpoint、AutoGen 的对话式协调)让 Agent 群体能根据任务动态调整协作方式,而非死板遵循预设流程——这正是第 5 重循环工程要展开的方向。
4.5 最佳实践:构建可信 AI 的六条铁律
基于 2025–2026 年业界实践,以下是构建可信 AI 系统的六条核心建议。
从设计阶段开始 · Shift Left
安全不是事后添加。需求阶段就明确:哪些场景高风险?哪些错误不可接受?哪些数据需保护?把安全和伦理写进设计文档与用户故事。
多层防御 · Defense in Depth
不依赖单一措施。理想架构多层:应用层(IO 过滤)→ 模型层(安全对齐)→ 框架层(护栏)→ 基础设施层(访问控制)。任一层被突破,其他层仍能兜底。
持续监控与反馈
AI 行为随时间变化——用户模式、模型更新、攻击手段都在变。持续监控 数据漂移、概念漂移、性能退化,建立快速回滚机制。
自动化测试
完整回归套件:Prompt 回归(改一个不应影响其他场景)、模型回归(更新后不降级)、安全回归(不引入新漏洞)。用 LLM 生成用例与对抗样本增强覆盖。
人机协同 · HITL
高风险场景始终保留人工监督。人机协同不仅满足合规,更在模型不可预测时提供最后保障。金融审批、医疗诊断、司法评估应强制人工审核。
透明与可解释
记录并暴露决策过程:用了哪些数据?参考哪些规则?置信度如何?趋势是过程可解释——不只解释"为什么这样决定",还解释"模型如何思考"。
4.6 收束:可信 AI 的六大特征
Harness 的终极目标是可信 AI(Trustworthy AI)。业界普遍认可的可信 AI 具备以下六大特征——它们正是四大支柱要共同守护的成果。
可靠性
安全性
公平性
透明性
隐私性
问责性
🔑 Harness 核心公式:
可信 AI = 可观测性 + 评估 + 防护 + 治理
四者缺一不可,共同构成 AI 系统的"安全带"与"方向盘"。
Harness 的跃迁意义:它把工程视野从"管好一次推理"上移到"管好整个系统的生命周期"。上下文工程保证单次最优,Harness 保证持续、可控、合规地长期运转——为更高一层的"循环工程"提供安全可信的底座。没有 Harness,再精巧的循环也只是在错误方向上高速空转。
5第 5 重 · 循环工程 Loop Engineering —— 2026 的前沿
前四重都在回答"如何让模型把这一次做好"。循环工程(Loop Engineering)换了个根本问题:与其一次次手动提示模型,不如设计一个能自主运转、自我改进的循环,让模型在循环里自己把任务推进到底。这是 2026 年最前沿的工程理念。
别再提示了,开始工程化循环。
—— Stop prompting, start engineering loops.
5.1 Agent Loop:循环的心跳
Anthropic 给 Agent 下了一个被广泛采纳的极简定义:Agent = LLM 在循环里自主调用工具。这个循环由四个阶段周而复始构成,类似军事上的 OODA(观察-判断-决策-行动)环:
(用户输入 / 工具结果)
该做什么
改变环境
是否达成目标
单次推理是开环的——模型给一个答案就结束。循环让它变成闭环:行动产生的新信息会被重新感知、重新推理。这正是 Agent 能处理"无法一步算清"的复杂任务的根基。前四重的所有工程(好的上下文、好的工具、好的护栏)都是为了让这个循环转得久、转得稳、转得对。
5.2 自我改进:反思循环(Reflection Loops)
5.3 开环 vs 闭环:人在哪儿
循环工程的一个核心设计抉择,是把人放在循环的什么位置。这决定了一个 Agent 是"工具"还是"自主 worker"。
🔵 开环 · 人在循环中
Human-in-the-Loop:循环的某些关键节点必须停下来等人确认——高风险操作前要人批准、模糊决策时要人拍板。安全性高、可控性强,适合金融审批、医疗、生产部署等不可逆场景。代价是吞吐量受限于人的速度。
🟣 闭环 · 全自主
Closed Loop:循环无需人工介入即可一直转到目标达成。Agent 自我感知、自我纠错、自我评估。吞吐量极高,适合大批量、可容错、可回滚的任务(如代码生成与自动测试、批量数据处理)。风险在于失控时的连锁错误。
2026 年的最佳实践不是二选一,而是按风险分级:低风险步骤闭环全自动跑(追求效率),高风险步骤切到开环等人确认(追求安全)。许多先进框架用"置信度阈值"自动在两者间切换——模型对自己的结果有把握时放行,没把握时主动求助。
5.4 Fleet Loops:循环的舰队
复杂任务往往无法用一个线性流程完成,需要并行探索、动态分工、结果整合。Fleet Loops 让 Agent 群体像一支有指挥的舰队:既保持每个单元的自主性与聚焦,又能协同攻下大目标。它也是 LangGraph、AutoGen、CrewAI 等编排框架(见本页 4.4 节)在循环工程语境下的最新演化方向。
循环工程社区在 2026 年达成一个共识:循环的天花板,由循环里的"验证器(Verifier)"决定。再强的执行循环,如果没法可靠判断"这一步到底做对没有",就会在错误方向上空转、或过早宣告成功。因此,工程化的重心正从"让 Agent 更能干"转向"让 Agent 更会判断自己做得对不对"——高质量的评估器、可验证的成功标准、可回滚的检查点,成为循环工程的核心基础设施。
循环工程的跃迁意义:前四重都在优化"单次推理",循环工程把战场移到了时间维度——它不再追求"这一次完美",而是追求"在持续运转中收敛到正确"。这是驾驭 AI 的抽象层级的最高一档:从"驯服单次输出",到"设计自主运转并自我改进的系统"。人不再逐次提示,而是设计循环。
收束:驾驭抽象层级的上升
把五重工程放回一张图。注意纵轴不是"技术难度",而是你驾驭的抽象层级——层级越高,单点技巧的杠杆越小,系统设计的杠杆越大。
一次输出
一句话
整个窗口
整个系统
自主循环
🔑 最终公式:这条进化链不是"新淘汰旧",而是层层包裹——你今天写的每一个循环工程系统里,都嵌着精心设计的上下文;每一段上下文里,都嵌着打磨过的提示词。
区别只在于:你的注意力,停留在哪一层。
模型越强,工程越重要——只是工程的重心,会不断上移到更高的抽象层。
—— AI 纪元 · 第 10 章📚 参考文献
从提示词到循环工程,五次跃迁打通了 AI 工程化的脉络。
理解了这套方法论之后,下一章我们将探讨如何在核心系统中落地 AI Coding 全流程。