🛠️ 工程演进 · 实战理念

AI 工程:从提示词到循环工程的五次跃迁

提示词、提示词工程、上下文工程、Harness、循环工程——这不是五个并列的技术名词,
而是一条清晰的进化链:模型越强、任务越长,"驾驭 AI"的工程抽象层级就越往上抬。
本文拆解 2025–2026 年业界最新实战理念,看懂每一次跃迁为何必然发生。

进化全景:驾驭抽象层级的五次抬升

先用一张图建立全局认知。下图中每一个节点都解决前一层的痛点,又暴露出新的问题,于是催生下一层。读懂这条链,就读懂了过去三年 AI 工程的全部主线。

LV.1
💬
提示词
Prompt
每次都要从头说,无法复用
──▶
LV.2
✍️
提示词工程
Prompt Engineering
只管"写好一句",忽略窗口里的其他 token
──▶
LV.3
🧩
上下文工程
Context Engineering
窗口会"腐烂",需要系统化管理整个 token 集
──▶
LV.4
⚙️
Harness
驾驭框架
从"管好一个请求"到"管好整个系统的生命周期"
──▶
LV.5
🔄
循环工程
Loop Engineering
不再逐次提示,而是工程化"自主运转的循环"

一句话主线:模型变强,并不会让"工程"消失——它只会把工程的重心从"驯服单次输出"不断上移到"设计自主运转的系统"。你驾驭的抽象层级越高,单点技巧的边际收益就越低,系统设计的杠杆就越大。

1第 1 重 · 提示词 Prompt —— 一切的起点

提示词(Prompt)是你喂给模型的原始输入文本。在模型眼里,你的话不是"中文句子",而是先被分词器切成一个个 token(词元),再变成向量,再送进 Transformer。提示词是一切 AI 工程的最小单元——就像源代码里的一个字符。

💬
提示词的本质:一段被 tokenize 的文本
Prompt = text → tokens → vectors → attention
一个提示词的好坏,本质上取决于它被切成的 token 序列能否激活模型训练时学到的高价值模式。这也是为什么同一件事,"请用 Python 写一个快速排序"和"作为资深算法工程师,请实现 Python 版快排并附复杂度分析"会得到截然不同的输出——后者激活的上下文模式更精准。提示词工程,就是从这里开始的。
⚙️ 为什么它是"第1重"且天然有局限

提示词是一次性的、单点的、无状态的。你每次发问,模型都从零开始读你的输入;上一轮说过的话(在没有记忆机制时)它全忘了。对于"一问一答"的聊天,这够了;但一旦任务需要多轮推进、需要记住中间结果,单点提示词立刻捉襟见肘——于是催生了提示词工程。

2第 2 重 · 提示词工程 Prompt Engineering —— 把一句话写好

提示词工程(Prompt Engineering)是编写和组织 LLM 指令以获得最佳结果的方法。它的核心战场是系统提示词(System Prompt)——那串在最开头、定义模型角色与规则的长文本。过去三年,业界沉淀出几条几乎万能的核心技巧。

🎯 系统提示词

System Prompt:在最开头设定角色、目标、约束、输出格式。它定义了模型的"工作人格",权重高于用户消息。是提示词工程的主战场

📝 少样本示例

Few-shot:在提示里给 2–5 个"输入→输出"范例。模型从示例中在上下文中学习(In-Context Learning)目标模式,比纯文字描述更有效。

🧠 思维链

Chain-of-Thought:要求模型"一步一步思考"再给答案。强迫模型展开中间推理,在数学、逻辑、多步任务上显著提升正确率。

🎭 角色设定

Role Prompting:赋予模型专业身份("你是资深安全审计员")。激活该领域的高价值知识权重,输出更专业、更聚焦。
🔍 2026 现状:单条技巧在衰减

这些技巧依然有用,但边际收益正在递减。原因有二:① 前沿模型(Claude 4 / GPT-5)本身已很强,"写好一句提示"带来的提升不再决定性;② 真实任务早已不是"一问一答",而是 Agent 在循环里跑几十上百轮——这时问题不再是"这句话怎么写",而是"窗口里堆积的几百轮工具调用结果,模型该怎么消化"。提示词工程的视野,够不到这里。

提示词工程的边界:它只回答"如何写好一条指令",却假设模型窗口里只有这一条指令。当窗口里挤满了系统提示、工具定义、检索文档、历史消息时,"写好一句话"救不了被淹没的关键信息——这就是上下文工程要接管的地方。

3第 3 重 · 上下文工程 Context Engineering —— 2025 的范式转移

2025 年,Anthropic 给出了一个已被业界广泛采纳的定义:上下文工程是在 LLM 推理时,策划和维护"最优 token 集合"的一整套策略——它不仅包括提示词,还包括所有可能进入窗口的东西:工具定义、检索文档、消息历史、外部数据。它是提示词工程的自然延伸

LLM 就像一种新的操作系统:模型是 CPU,上下文窗口是 RAM,是模型的工作内存。就像 RAM 容量有限,上下文窗口能承载的上下文来源也有限。正如操作系统负责调度什么进入 CPU 的 RAM,"上下文工程"扮演着类似的角色——用恰好正确的信息,填满上下文窗口以服务下一步

定义 Andrej Karpathy · 上下文工程的核心心智模型

3.1 为什么必须做:Context Rot(上下文腐烂)

⚙️ 核心原理

"大海捞针"(needle-in-a-haystack)基准测试揭示了一个现象——上下文腐烂:随着上下文窗口里的 token 数量增加,模型准确召回其中信息的能力反而下降。原因有三:
注意力预算:上下文是有限资源,有递减的边际收益,每个新 token 都在消耗这个预算;
n² 注意力关系:Transformer 让每个 token 关注所有其他 token,n 个 token 产生 n² 对关系,上下文越长,这些关系被拉得越薄;
训练分布偏短:模型在训练中见过的短序列远多于长序列,对长程依赖缺乏专门参数。
因此,把上下文当宝贝、当有限资源来精打细算,是构建强 Agent 的前提。

3.2 上下文为什么会"坏掉":四种失败模式

Drew Breunig 在 2025 年系统总结了长上下文导致 Agent 性能下降的四种典型方式。理解它们,才知道上下文工程要解决什么。

上下文中毒
Context Poisoning

一次幻觉混进了上下文,后续每一轮都把它当"既定事实"继续推理,错误像滚雪球一样累积放大。

上下文分心
Context Distraction

无关信息淹没了训练信号。模型被海量 token 分散注意力,抓不住真正关键的那几条指令。

上下文混淆
Context Confusion

冗余的上下文干扰了响应。即便是"有用但多余"的信息,也会让模型在取舍间偏离最优解。

上下文冲突
Context Clash

上下文的不同部分相互矛盾(如过时的旧指令与新指令打架),模型无所适从,行为变得不可预测。

3.3 四大策略:Write / Select / Compress / Isolate

LangChain 把业界应对手段归纳为四个动词。这是上下文工程的核心工具箱,几乎每一个强 Agent 都在用其中几种。

WRITE · 写出

把上下文写到窗口之外

saving context outside the window

Agent 把信息存到窗口外,需要时再取。草稿本(Scratchpad):在任务进行中记笔记到文件或状态对象;记忆(Memory):跨会话持久化,如 Reflexion 的"反思记忆"、ChatGPT/Cursor 的长期记忆。

→ Anthropic 多 Agent 研究员:计划存入 Memory,避免超 200K token 被截断
SELECT · 选择

把上下文拉进窗口

pulling context into the window

从外部按需取回相关信息。读取草稿本、检索记忆、对工具描述做 RAG、对知识库做 RAG。代码 Agent 尤其典型:用 grep/文件搜索 + 知识图谱 + 重排序,精准取回相关代码。

→ Claude Code 用 CLAUDE.md 预载规则;ChatGPT 从大量记忆中按需检索
COMPRESS · 压缩

只保留必需的 token

retaining only required tokens

摘要(Summarization):用 LLM 蒸馏关键内容,如 Claude Code 在用到 95% 窗口时自动压缩(auto-compact)整段轨迹;裁剪(Trimming):按硬规则删旧消息、清掉已用完的工具调用结果。

→ Cognition:在 Agent 间交接处做摘要,减少 token 传递
ISOLATE · 隔离

把上下文拆分开

splitting context up

多 Agent:每个子 Agent 独占干净窗口,专攻子任务,只回传浓缩摘要;沙箱环境:把重 token 对象(图片/大数据)隔离在运行环境里;状态对象:用 schema 字段隔离信息,按需暴露给 LLM。

→ Anthropic:多 Agent 并行探索,各自窗口聚焦子问题

3.4 有效上下文的解剖:不只是"多",而是"精"

Anthropic 给出一条总原则:好的上下文工程,是找到最小的高信号 token 集,最大化达成目标的概率。这落到三个组件上:

🎯 系统提示词的"正确高度"

系统提示要在两个极端之间找到金发姑娘区(Goldilocks Zone):一端是把复杂逻辑硬编码成脆弱的 if-else(维护噩梦、模型稍变就崩);另一端是给一句含糊的高层指导(模型拿不到具体信号、错误假设共享上下文)。最优解是具体到足以引导行为,又灵活到能提供强启发式。组织提示时用 <background> / ## Tool guidance 等分段 + XML/Markdown 标签切分。

🛠️ 工具要"Token 高效 + 功能不重叠"

工具定义了 Agent 与信息/动作空间的契约。两个常见病:① 工具返回的信息太啰嗦,浪费预算;② 功能重叠导致模型不知道该调哪个——"如果连人类工程师都说不清该用哪个工具,就别指望 AI 选对"。原则:自包含、健壮、用途极清晰,输入参数要发挥模型的长处。

📝 示例要"少而精",别列 laundry list

很多团队往提示里塞一长串边界案例当规则。Anthropic 强烈建议反其道而行:精选一组多样、规范的范例来示范期望行为。对 LLM 而言,"一个好示例胜过千言万语"——示例是它最看得懂的"图"。

3.5 即时检索:Claude Code 的混合策略

传统的 RAG 是推理前一次性预检索所有相关数据塞进窗口。新趋势是 "即时"(just-in-time)策略:Agent 只在窗口里保留轻量标识符(文件路径、查询语句、网页链接),运行时用工具动态加载真正需要的数据。这模仿了人类——我们不背诵整个语料库,而是靠文件系统、收件箱、书签按需取用。

⚡ Claude Code 的真实做法

Claude Code 采用混合策略CLAUDE.md 文件在启动时朴素地预载进上下文(提供项目规则),而 glob / grep 等原语让它即时导航环境、按需取文件。这样既绕过了"陈旧索引"问题,又不需要复杂的语法树。文件名、目录层级、时间戳本身就是元数据信号——一个叫 test_utils.py 的文件放在 tests/ 还是 src/core/,暗示着截然不同的用途。

3.6 长时程任务三件套

当任务跨越几十分钟到数小时(如大型代码库迁移、综合研究),token 量必然超过窗口。Anthropic 给出三把利器——注意,它们正对应上面四大策略的 Compress / Write / Isolate:

🗜️

压缩 Compaction

对应 Compress
把临近窗口上限的对话摘要后重启新窗口。Claude Code 会保留架构决策、未解决 bug、实现细节,丢弃冗余工具输出。艺术在于取舍——过度压缩会丢掉后来才显出价值的关键细节。
📒

结构化笔记

对应 Write · Agentic Memory
Agent 定期把笔记写到窗口外的记忆(如 NOTES.md、todo list),稍后拉回。Claude 玩宝可梦是经典案例:它自动维护探索地图、记录招式克制关系,跨数小时训练保持连贯。
🔀

子 Agent 架构

对应 Isolate
专用子 Agent 用干净窗口处理聚焦任务,主 Agent 只做高层协调。每个子 Agent 可能消耗数万 token,但只回传 1–2K 的浓缩摘要。关注点分离,效果远超单 Agent。

"上下文工程"……实际上是构建 AI Agent 的工程师的头号工作
Agent 经常进行跨越数百轮的对话,需要谨慎的上下文管理策略。

业界共识 Cognition(Devin 团队)· Anthropic

上下文工程的跃迁意义:它把工程师的视野从"一句话"扩展到"模型在每一步看到的整个世界"。但请注意——它仍在回答"如何让单次推理更好"。当系统需要持续运行、自我纠错、协调多个 Agent、满足合规与安全时,单点优化不够了,必须上升为系统级框架。那就是 Harness。

4第 4 重 · Harness —— 从"管好一个请求"到"管好整个系统"

Harness(驾驭框架)是上下文工程的系统化与生产化。上下文工程关注"单次推理的 token 质量",Harness 则回答一个更硬的问题:当 AI 系统从实验室 demo 走向生产、从一段个人脚本变成影响千万人的服务,如何保证它可靠、安全、可控、合规?这是把 AI 从"能用"变成"敢用、可信"的那一层工程脚手架。

⚙️
Harness = 上下文工程的系统归宿
From single-inference to full lifecycle
Harness 的四大支柱——可观测性(追踪每次调用的延迟/成本/质量)、评估(量化"智能"、LLM-as-a-Judge)、防护(输入输出护栏、访问控制)、治理(NIST AI RMF、EU AI Act 合规)——本质上都是在系统层面保障上下文工程能持续、可控地运转。没有可观测性,你不知道上下文哪里腐烂了;没有评估,你不知道压缩是否丢了关键信息;没有防护,精心设计的上下文会被一次注入瞬间污染。
🔗 连接点:为什么 Harness 是必然

上下文工程解决了"单点最优",但生产系统是长跑:模型会更新、数据会漂移、攻击会进化、合规会收紧。Harness 把这些动态因素纳入一个闭环——监控 → 评估 → 防护 → 治理 → 反馈改进。它是上下文工程从"工艺"升级为"工程学科"的那一层脚手架。

4.0 同一个词的四层含义

"Harness"在不同语境下指向不同的东西——理解这四层,才不会把"工具""方法""架构""目标"混为一谈。

狭义 · 工具平台

AI 开发 Harness

AI Development Harness

一套具体的工具链与平台,覆盖从提示管理、模型评估到部署监控的全生命周期。代表:LangSmithArize PhoenixLangfuse

广义 · 治理框架

AI 治理框架

AI Governance Framework

一套系统性方法,确保 AI 在设计、训练、部署到退役的全生命周期中,始终符合人类价值观、法律规范与社会伦理。代表:NIST AI RMFEU AI Act

工程 · 架构模式

Agent 编排引擎

Agent Orchestration Engine

协调多个 Agent 协同工作的架构模式,解决"单个 Agent 能力有限"的问题。代表:LangGraphAutoGenCrewAI

核心 · 终极目标

可信 AI

Trustworthy AI

Harness 的终极目标——具备可靠性、安全性、公平性、透明性等特征的 AI 系统,才是真正值得信任的 AI。

4.1 为什么必须:AI 系统的五大独特风险

AI 越强大,风险越呈指数级增长。这些风险既不同于传统软件缺陷,也有别于信息安全领域的传统威胁——它们是模型原生的。

幻觉与事实性错误
Hallucination

LLM 会生成看似合理、逻辑自洽却完全错误的内容。幻觉是模型的"原生日"——它本质是概率生成器,而非事实数据库。在 RAG 场景下,常表现为编造引用来源、曲解检索内容

提示注入与越狱
Prompt Injection / Jailbreak

攻击者精心设计的提示词可绕过护栏诱导有害输出。Direct Injection(直接注入恶意指令)、Indirect Injection(经输入数据间接注入)、Jailbreak(角色扮演、多轮诱导)。研究显示仅约 55% 的 LLM 能在充分红队测试后保持 90%+ 防护率。

偏见与歧视
Bias & Discrimination

AI 会继承训练数据中的社会偏见,在性别、种族、年龄等维度产生不公平决策——嵌入在词汇偏好、推荐排序、识别准确率差异之中。

隐私泄露
Privacy Leakage

模型可能在生成时"遗忘"并复现训练数据里的隐私成员推断攻击模型反演攻击是两大核心威胁。

不可预测性与鲁棒性
Unpredictability

AI 在分布外(OOD)数据上行为往往不可预测——训练集上优异的模型,真实场景中可能因微小输入变化产生灾难性输出。对抗样本是最极端的案例。

强大的 AI 系统如果没有适当的治理框架,就像没有刹车的赛车——速度越快,危险越大。

警示 AI 安全研究者

4.2 四大支柱:可观测性 / 评估 / 防护 / 治理

业界共识:一个成熟的 AI Harness 应包含四大支柱,相辅相成,缺一不可。它们恰好构成一条从"看见 → 衡量 → 约束 → 合规"的完整闭环。

4.2.1 可观测性 — 看见看不见的

AI 系统的"内部思维"不可见,传统软件监控不够用——需要专门的技术来"看透"它的决策过程。

📊

分布式追踪

Distributed Tracing
在 Agent 调用链、RAG 流程、多轮对话中追踪每次 LLM 调用的延迟、成本、IO。核心指标:首 Token 延迟(TTFT)、总延迟、Token 成本。
📝

结构化日志

Structured Logging
记录每次调用的 prompt、completion、temperature、top_p 等参数,及下游系统(数据库、向量库、工具)响应,支持事后复现与调试
📈

指标面板

Metrics Dashboard
实时展示 Token 消耗趋势、错误率、延迟分布、各 Prompt 版本性能对比,支持告警阈值与异常检测
🔍

质量评分

Quality Scoring
对输出自动评分——基于启发式规则(长度、JSON 有效性)、LLM-as-a-Judge、嵌入向量相似度等多维度。

🔑 趋势:2025–2026 年,可观测性正从"事后调试"升级为"实时质量感知"——新一代平台不仅能记录发生了什么,还能主动识别质量下降的早期信号。

4.2.2 评估 — 量化"智能"

评估是 Harness 的核心环节——没有评估,一切改进都是盲人摸象。2025 年起,AI 评估已发展为一门系统科学。

METHOD · 基准测试

自动化基准测试

MMLUGSM8KHumanEval 等标准化基准测知识广度、数学推理、代码生成;新兴的 SWE-bench 直接测代码修复。但基准无法完全覆盖真实场景

METHOD · 模型评审

LLM-as-a-Judge

用更强的模型对输出质量自动打分。精心设计 Prompt 让 LLM 扮演评判者。已形成 AutoEvalChatbot Arena 等成熟框架。

METHOD · 端到端

端到端场景测试

构建真实用户场景模拟完整工作流:客服 Agent 能否 5 轮内解决问题?RAG 能否答对专业问题?用 RAGASGiskard 评估召回率、忠实度等。

📐 RAG 系统专属评估指标

📥

上下文召回率

Context Recall
检索到的片段中,有多少比例包含生成答案所需的信息?衡量检索系统能否找到"正确的知识"。
🎯

上下文精确率

Context Precision
检索到的片段中,有多少比例与问题真正相关?衡量检索系统的"精准度"。

忠实度

Faithfulness
生成答案的每句话是否都能在检索上下文中找到依据?衡量"忠实于来源"的程度,是对抗幻觉的关键指标。
💡

答案相关性

Answer Relevancy
生成的答案是否直接回应了原始问题?衡量最终输出的实用性。

4.2.3 防护 — 安全边界

防护机制确保 AI 在安全边界内运行,是最后一道防线,分输入、输出、访问、运行时四道关。

🛡️

输入防护

Input Guard
输入验证:过滤恶意 prompt、PII、恶意指令。注入检测:识别"忽略之前指令"等攻击模式。内容过滤:拦截有毒/仇恨言论。
🛡️

输出防护

Output Guard
输出过滤:拦截有害/偏见输出。事实校验:核查生成内容与来源一致性。PII 保护:自动脱敏。
🛡️

访问控制

Access Control
RBAC:基于角色的权限。API 密钥管理:轮换、限流、配额。模型选择策略:按用户角色选不同级别模型。
🛡️

运行时护栏

Runtime Guardrail
Rate Limiting:控频防滥用。熔断机制:错误率超阈值自动降级。人工审核:高风险操作需人工批准。

🛡️ 主流护栏框架

FRAMEWORK

Guardrails.as

开源框架,通过控制器(Controllers)验证输入、提取输出。支持 JSON Schema 提取、格式校验、自定义验证逻辑,适合结构化输出场景。

FRAMEWORK

NeMo Guardrails

NVIDIA 开源,用 SpeakZ DSL 定义对话流程与行为约束,支持多轮对话的受控生成,内置安全防护套件。

FRAMEWORK

Microsoft Guidance

轻量级框架,支持 JSON Schema 引导、正则约束、提示模板复用,适合严格输出格式控制的场景。

MODEL · META

Llama Guard

Meta 开源的内容安全护栏模型,专检不安全请求与输出,覆盖10 大类安全风险(暴力、仇恨等),支持多语言。

4.2.4 治理 — 制度保障

治理是 Harness 的顶层制度保障,确保 AI 在全生命周期中合规运行——技术之外,更是法规与组织流程。

NIST AI RMF
风险管理框架 · 美国

美国 NIST 发布的 AI Risk Management Framework,全球最具影响力的治理框架之一。四大核心功能:治理(Govern)→ 映射(Map)→ 测量(Measure)→ 管理(Manage)。2023 年发布 1.0,持续更新落地指南。

EU AI Act
欧盟人工智能法案

2024 年通过,全球首部全面规范 AI 的法律。按风险分四级:不可接受(禁止,如社会评分)、高风险(医疗/司法/招聘,需严格合规)、有限风险(透明度要求)、最小风险。违规罚款最高达全球营收 7%

企业级 AI 治理
Enterprise Practice

大型企业普遍设立 AI 治理委员会审批高风险项目。关键实践:模型注册表、变更管理、审计追踪、偏见检测、人类监督——所有决策可追溯、可问责。

4.3 技术栈全景:2025–2026 工具选型

AI Harness 工具生态这两年爆发式增长。以下按四大支柱的功能维度给一张选型参考——不必全用,按风险与规模按需取用

🔍 可观测性与追踪

🦜

LangSmith

LangChain 官方
端到端调试与监控平台,支持链式调用追踪、输出评估、A/B 测试不同 Prompt 版本。
🔥

Langfuse

开源 · 可自部署
开源 LLM 可观测性平台,支持分布式追踪、Prompt 版本管理、质量指标监控,数据完全自控。
🦅

Arize Phoenix

开源 · 可视化
向量可视化与模型解释工具,内置 embedding 空间探索、RAG 评估、embedding 模型对比。
📡

AgentOps

Agent 专用
专为 Agent 设计的可观测性框架,支持 Agent 轨迹记录、工具调用追踪、Agent-to-Agent 通信监控。

🧪 评估与测试

📐

RAGAS

RAG 评估
专为 RAG 设计的评估框架,自动计算上下文召回率、忠实度、答案相关性等核心指标,无需人工标注
🧪

Giskard

ML/LLM 测试
开源测试平台,支持幻觉检测、偏见分析、对抗测试、回归测试,提供图形界面与 REST API。
⚔️

红队工具

Red Teaming
Garak(LLM 脆弱性扫描器)、Promptfoo,自动化识别模型的弱点和安全漏洞。

🛡️ 安全防护

🚧

OpenAI Moderation API

内容审核
实时检测仇恨、暴力、色情、自残等有害内容,支持多语言。
🔐

DryIce

IO 防护
专注 LLM 输入/输出防护,检测提示注入、越狱、PII 泄露、有害内容,提供低延迟实时防护
🛡️

Guardrails.as

结构化生成
通过控制器模式定义输入验证与输出提取规则,支持自定义验证逻辑。

4.4 Agent 编排:Harness 在 Agent 时代的核心场景

单个 Agent 能力有限,复杂任务需要多个 Agent 协同——这就引出 Agent 编排(Orchestration),Harness 在 Agent 时代的核心应用,也是通向第 5 重"循环工程"的桥梁。

🔗 四种编排模式

MODE · 顺序

流水线模式

Agent A → Agent B → Agent C,每个 Agent 负责一个阶段,顺序执行。最简单,适合流程清晰的任务。

MODE · 分发

路由模式

Router Agent 根据输入类型,选择最适合的专用 Agent处理。像调度员,把请求分到对口专家。

MODE · 并行

协作模式

多个 Agent 并行工作、共享上下文、互相调用工具,最终综合结果。适合需要多视角融合的任务。

MODE · 分派

层级模式

Manager Agent 拆解任务并分发给 Worker Agent,最后汇总。正是第 5 重"Fleet Loops"的雏形。

🤖 主流编排框架

🦜

LangGraph

LangChain · 有向图
基于有向图建模 Agent 流程,支持循环、条件分支、状态持久化。核心哲学:Agent 是图,不是链
🤖

AutoGen

Microsoft · 对话式
多 Agent 对话框架,支持多角色(开发者、产品经理、测试工程师)之间自然语言对话完成任务。
👥

CrewAI

角色 · 流程 · 工具
以"角色-流程-工具"为核心理念:定义每个 Agent 的角色、目标、工具,框架自动编排执行流程。

🔑 趋势:Agent 编排正从"硬编码流程"走向"动态推理"。新一代框架(LangGraph 的 Checkpoint、AutoGen 的对话式协调)让 Agent 群体能根据任务动态调整协作方式,而非死板遵循预设流程——这正是第 5 重循环工程要展开的方向。

4.5 最佳实践:构建可信 AI 的六条铁律

基于 2025–2026 年业界实践,以下是构建可信 AI 系统的六条核心建议。

RULE 1

从设计阶段开始 · Shift Left

安全不是事后添加。需求阶段就明确:哪些场景高风险?哪些错误不可接受?哪些数据需保护?把安全和伦理写进设计文档与用户故事。

RULE 2

多层防御 · Defense in Depth

不依赖单一措施。理想架构多层:应用层(IO 过滤)→ 模型层(安全对齐)→ 框架层(护栏)→ 基础设施层(访问控制)。任一层被突破,其他层仍能兜底。

RULE 3

持续监控与反馈

AI 行为随时间变化——用户模式、模型更新、攻击手段都在变。持续监控 数据漂移、概念漂移、性能退化,建立快速回滚机制。

RULE 4

自动化测试

完整回归套件:Prompt 回归(改一个不应影响其他场景)、模型回归(更新后不降级)、安全回归(不引入新漏洞)。用 LLM 生成用例与对抗样本增强覆盖。

RULE 5

人机协同 · HITL

高风险场景始终保留人工监督。人机协同不仅满足合规,更在模型不可预测时提供最后保障。金融审批、医疗诊断、司法评估应强制人工审核

RULE 6

透明与可解释

记录并暴露决策过程:用了哪些数据?参考哪些规则?置信度如何?趋势是过程可解释——不只解释"为什么这样决定",还解释"模型如何思考"。

4.6 收束:可信 AI 的六大特征

Harness 的终极目标是可信 AI(Trustworthy AI)。业界普遍认可的可信 AI 具备以下六大特征——它们正是四大支柱要共同守护的成果。

🎯

可靠性

Reliability
在各种条件下稳定运行,性能指标可量化、可预测、可复现
🛡️

安全性

Safety
不对人类造成身体、心理、社会伤害,有完善的故障安全机制
⚖️

公平性

Fairness
对所有群体一视同仁,不因性别、种族、年龄产生系统性偏见
👁️

透明性

Transparency
决策过程可理解、可解释,用户能了解"AI 为什么这样决定"。
🔒

隐私性

Privacy
尊重并保护用户隐私,数据最小化原则,具备遗忘与删除能力。
🤝

问责性

Accountability
明确的责任归属与审计追踪,决策可追溯、可问责

🔑 Harness 核心公式:
可信 AI = 可观测性 + 评估 + 防护 + 治理
四者缺一不可,共同构成 AI 系统的"安全带"与"方向盘"。

Harness 的跃迁意义:它把工程视野从"管好一次推理"上移到"管好整个系统的生命周期"。上下文工程保证单次最优,Harness 保证持续、可控、合规地长期运转——为更高一层的"循环工程"提供安全可信的底座。没有 Harness,再精巧的循环也只是在错误方向上高速空转。

5第 5 重 · 循环工程 Loop Engineering —— 2026 的前沿

前四重都在回答"如何让模型把这一次做好"。循环工程(Loop Engineering)换了个根本问题:与其一次次手动提示模型,不如设计一个能自主运转、自我改进的循环,让模型在循环里自己把任务推进到底。这是 2026 年最前沿的工程理念。

别再提示了,开始工程化循环
—— Stop prompting, start engineering loops.

2026 口号 Loop Engineering 社区共识

5.1 Agent Loop:循环的心跳

Anthropic 给 Agent 下了一个被广泛采纳的极简定义:Agent = LLM 在循环里自主调用工具。这个循环由四个阶段周而复始构成,类似军事上的 OODA(观察-判断-决策-行动)环:

👁️
感知
读取环境与上下文
(用户输入 / 工具结果)
──▶
🧠
推理
决定下一步
该做什么
──▶
🛠️
行动
调用工具
改变环境
──▶
评估
检查结果
是否达成目标
◀──
↑ 评估结果回灌感知,循环往复,直到目标达成或触发停止条件
⚙️ 核心原理:循环让模型"活着"

单次推理是开环的——模型给一个答案就结束。循环让它变成闭环:行动产生的新信息会被重新感知、重新推理。这正是 Agent 能处理"无法一步算清"的复杂任务的根基。前四重的所有工程(好的上下文、好的工具、好的护栏)都是为了让这个循环转得久、转得稳、转得对

5.2 自我改进:反思循环(Reflection Loops)

🪞
反思循环
Reflection Loop · 自我评估并迭代
Agent 在每轮结束后评估自己的输出,把"哪里做得不好、下次怎么改"记成记忆,下一轮带着这个反思继续。经典论文 Reflexion 开创了这条路线。它让 Agent 拥有了从自身经验中学习的能力——不更新权重,只在上下文/记忆里累积经验。
🔁
递归自评估
Recursive Self-Evaluation
把"评估"本身也变成一个可迭代的循环:模型不仅检查输出,还检查自己的检查是否到位。配合元提示(Meta-Prompting)——用一个更高层的提示去优化底层提示——形成层层递进的自我纠偏机制。

5.3 开环 vs 闭环:人在哪儿

循环工程的一个核心设计抉择,是把人放在循环的什么位置。这决定了一个 Agent 是"工具"还是"自主 worker"。

🔵 开环 · 人在循环中

Human-in-the-Loop:循环的某些关键节点必须停下来等人确认——高风险操作前要人批准、模糊决策时要人拍板。安全性高、可控性强,适合金融审批、医疗、生产部署等不可逆场景。代价是吞吐量受限于人的速度。

🟣 闭环 · 全自主

Closed Loop:循环无需人工介入即可一直转到目标达成。Agent 自我感知、自我纠错、自我评估。吞吐量极高,适合大批量、可容错、可回滚的任务(如代码生成与自动测试、批量数据处理)。风险在于失控时的连锁错误。

🎯 实战建议:混合模式

2026 年的最佳实践不是二选一,而是按风险分级:低风险步骤闭环全自动跑(追求效率),高风险步骤切到开环等人确认(追求安全)。许多先进框架用"置信度阈值"自动在两者间切换——模型对自己的结果有把握时放行,没把握时主动求助。

5.4 Fleet Loops:循环的舰队

🚢
舰队循环 Fleet Loops
One loop, self-improving · multi-agent orchestration
当单个循环不够,就把它扩展成一支舰队:一个编排器(Orchestrator)拿到总目标,拆解成子目标,把每个子目标委派给一个独立运转的子循环(子 Agent)。每个子循环自主跑、自我改进,完成后向编排器汇报,编排器综合结果、必要时重新分配。这正是上下文工程"Isolate 隔离"策略的循环级升华——不仅隔离上下文,还隔离整个执行循环。
⚙️ 为什么是趋势

复杂任务往往无法用一个线性流程完成,需要并行探索、动态分工、结果整合。Fleet Loops 让 Agent 群体像一支有指挥的舰队:既保持每个单元的自主性与聚焦,又能协同攻下大目标。它也是 LangGraph、AutoGen、CrewAI 等编排框架(见本页 4.4 节)在循环工程语境下的最新演化方向。

⚠️ 验证器是瓶颈

循环工程社区在 2026 年达成一个共识:循环的天花板,由循环里的"验证器(Verifier)"决定。再强的执行循环,如果没法可靠判断"这一步到底做对没有",就会在错误方向上空转、或过早宣告成功。因此,工程化的重心正从"让 Agent 更能干"转向"让 Agent 更会判断自己做得对不对"——高质量的评估器、可验证的成功标准、可回滚的检查点,成为循环工程的核心基础设施。

循环工程的跃迁意义:前四重都在优化"单次推理",循环工程把战场移到了时间维度——它不再追求"这一次完美",而是追求"在持续运转中收敛到正确"。这是驾驭 AI 的抽象层级的最高一档:从"驯服单次输出",到"设计自主运转并自我改进的系统"。人不再逐次提示,而是设计循环

收束:驾驭抽象层级的上升

把五重工程放回一张图。注意纵轴不是"技术难度",而是你驾驭的抽象层级——层级越高,单点技巧的杠杆越小,系统设计的杠杆越大。

LV.1
提示词
驯服
一次输出
LV.2
提示词工程
写好
一句话
LV.3
上下文工程
管好
整个窗口
LV.4
Harness
管好
整个系统
LV.5
循环工程
设计
自主循环

🔑 最终公式:这条进化链不是"新淘汰旧",而是层层包裹——你今天写的每一个循环工程系统里,都嵌着精心设计的上下文;每一段上下文里,都嵌着打磨过的提示词。
区别只在于:你的注意力,停留在哪一层。

模型越强,工程越重要——只是工程的重心,会不断上移到更高的抽象层。

—— AI 纪元 · 第 10 章

📚 参考文献

文章 Anthropic "Effective Context Engineering for AI Agents" 2025. — 上下文工程的权威定义、Context Rot、有效上下文解剖、长时程任务三件套。本文第 3 章核心来源。
文章 LangChain "Context Engineering for Agents" 2025.07. — Write / Select / Compress / Isolate 四大策略框架的经典归纳。
观点 Andrej Karpathy "LLM as Operating System" — LLM 是 CPU、上下文窗口是 RAM 的核心心智模型。
文章 Drew Breunig "Context Engineering 四种失败模式" 2025. — Poisoning / Distraction / Confusion / Clash 的系统总结。
实践 Manus "Context Engineering for AI Agents: Lessons from Building Manus" 2025. — 工业界构建 Agent 的上下文工程实战经验。
观点 Cognition(Devin 团队) "Don't build multi-agents" / 上下文工程论断 — "上下文工程是构建 Agent 工程师的头号工作"。
论文 Shinn et al. "Reflexion: Language Agents with Verbal Reinforcement Learning" 2023. — 反思循环(Reflection Loop)与自生成记忆的开创性工作。
文章 MindStudio "What Is Loop Engineering? The New Meta for AI Coding Agents" 2026. — 循环工程的核心定义与"停止提示、开始工程化循环"的口号。
文章 AI Builder Club "Loop Engineering Guide (2026)" — 验证器瓶颈、开环 vs 闭环的工程化设计。
法规 NIST "AI Risk Management Framework (AI RMF 1.0)" 2023. — 治理 / 映射 / 测量 / 管理四大功能,第 4 重 Harness 治理支柱的权威来源。
法规 欧盟委员会 "EU AI Act" 2024. — 全球首部全面规范 AI 的法律,按风险分级的合规要求。
关联 本系列 第 6–7 章 · AI Agent:原理、架构与开发实战 — 从 Agent 工作原理到框架、MCP、Skill 与工程实践的完整基础。

从提示词到循环工程,五次跃迁打通了 AI 工程化的脉络。
理解了这套方法论之后,下一章我们将探讨如何在核心系统中落地 AI Coding 全流程。