大语言模型
在前一章中,我们系统学习了深度学习的核心架构。而大语言模型(LLM)——从 GPT 到 Claude,从 LLaMA 到 DeepSeek——正是深度学习在自然语言领域最璀璨的成果。这一章,我们将深入 LLM 的世界,从基础常识到训练推理,从核心概念到开源生态,完整梳理你需要的所有知识。
在前面我们了解了深度学习的基本架构。接下来我们将聚焦于当前AI世界最耀眼的主角——大语言模型(Large Language Model, LLM)。在深入训练和推理细节之前,我们需要先掌握一些最基本的概念和常识。这些是你跟任何AI从业者聊天时都会遇到的"行话"。
大语言模型不是一个简单的"猜词游戏"。它不是鹦鹉学舌。当你拥有足够大的模型、足够多的数据时,它展现出的是对世界深刻的统计理解——一种压缩的世界模型。
—— Ilya Sutskever,OpenAI 联合创始人兼首席科学家什么是大语言模型?
大语言模型可以理解为一种"超级文本续写引擎"。给它一段文字,它预测下一个词最可能是什么。重复这个过程,就生成了整段回答。但就是这么简单的一件事,当模型规模足够大时,神奇的事情发生了——它"涌现"出了阅读理解、逻辑推理、代码生成、翻译总结等高级能力。
🧩 核心直觉
LLM 本质上是一个巨大的概率分布函数:P(下一个词 | 前面的所有词)。它通过海量文本训练,学会了"在什么上下文中,什么词出现的概率最大"。这个概率分布极其复杂——它编码了语法规则、事实知识、推理模式,甚至文化常识。
📏 什么是"大"?
"大"体现在两个维度:参数量(GPT-3 的 1750 亿,LLaMA-3 的 700 亿)和训练数据量(数万亿 token)。更大的模型 + 更多的数据 = 更强的涌现能力。Size Matters——这是过去几年AI领域最重要的经验法则。
模型架构两大流派:稠密模型 vs 混合专家模型(MoE)
这是大语言模型最根本的架构分野。它决定了模型怎么用参数、怎么算得快、怎么扩展规模。
🧱 稠密模型(Dense Model)
定义:前馈网络(FFN)层的所有参数全部激活——每个输入词元(token)都会经过所有神经元。
- 代表模型 — GPT-3、LLaMA 系列、Mistral 7B、Qwen 系列
- 优点 — 架构简单,训练稳定,推理实现容易。每个 token 的计算量是恒定的
- 缺点 — 参数利用率低:所有 token 都经过所有参数,但大部分可能不需要。扩展规模时计算量线性增长
- 直觉类比 — 就像一家公司里,所有员工处理每一个任务——小事大事全员出动,资源浪费但管理简单
🔀 混合专家模型(MoE — Mixture of Experts)
定义:FFN 层被替换为多个"专家"子网络(Expert),每个 token 只激活其中一部分专家(通常 top-2)。由一个"路由网络"(Router/Gate)决定该 token 应该交给哪些专家处理。
- 代表模型 — Mixtral 8×7B、DeepSeek-V2/V3、Qwen2-MoE、GPT-4(推测架构)
- 优点 — 参数量巨大但计算量持平。以 Mixtral 8×7B 为例:总参数 47B,但每个 token 只激活 7B × 2 专家 ≈ 14B 参数,推理速度和 14B 稠密模型持平,但效果接近 47B
- 缺点 — 训练不稳定(专家"坍塌"——某些专家学废了);路由负载不均衡;推理需要更多显存(所有专家参数都要加载)
- 直觉类比 — 就像一家公司里,每个任务只分配给对应领域的专家团队——效率高、专业强,但管理复杂
🔁 稠密 vs MoE:一次处理两个词元的对比
假设模型有 8 个"专家"。稠密模型中,每个词元都要经过全部参数;MoE 模型中,每个词元只激活最适合它的 2 个专家。
▲ 左:稠密模型——Token A 和 B 都经过全部 8 个专家(所有参数激活)。右:MoE——Router 为 Token A 分配专家 E1、E3,为 Token B 分配 E2、E8,其他专家闲置。MoE 的参数量更大但计算量更小。
💡 为什么 MoE 越来越流行?
Token:LLM 世界的"原子"
Token 是 LLM 处理文本的基本计量单位。它不是"字"也不是"词",而是一种介于两者之间的子词(Subword)单元。理解 Token 是理解 LLM 一切特性的基础。
🔤 Token 的直觉理解
想象你面前有一段英文文本。Token 化(Tokenization)的任务是:"把这个句子切成若干个小块,每个小块是一个 Token。"常见词("the"、"is"、"and")每个就是一个 Token;罕见词("antidisestablishment")可能被切成多个 Token;中文每个字通常就是一个 Token。
"我爱深度学习" → ["我", "爱", "深", "度", "学", "习"] (6 个 Token)
"unhappiness" → ["un", "happi", "ness"] (3 个 Token)
LLM 家族三兄弟:Encoder、Decoder、Encoder-Decoder
Transformer 架构有三个变体,分别适应不同的任务类型。理解它们的区别,你就基本理解了市面上所有 LLM 的基因。
🔍 Encoder-Only(编码器)
代表:BERT、RoBERTa、ERNIE
擅长:文本分类、命名实体识别(NER)、情感分析、语义相似度
不擅长:文本生成(需要额外加 Decoder 头)
📝 Decoder-Only(解码器)
代表:GPT 系列、LLaMA、Mistral、Qwen、DeepSeek
擅长:文本生成、对话、代码生成、翻译、任何"续写"任务
地位:目前绝对主流——几乎所有现代 LLM 都采用 Decoder-Only 架构
🔄 Encoder-Decoder(编码器-解码器)
代表:T5、BART、Flan-T5
擅长:翻译、摘要、文本转换类任务(输入和输出差异较大时)
现状:在 LLM 时代逐渐式微,但在特定任务(如翻译、摘要)上仍有优势
📊 为什么 Decoder-Only 赢了?
2020 年以来的经验表明:Decoder-Only 的因果语言模型在大规模预训练后,涌现出了包括理解、推理在内的几乎所有能力。GPT-3 证明了"纯生成"足以表达所有智能行为。加上 Decoder-Only 训练更简单(只需一个目标函数:下一个词预测)、推理更高效(不需要 Encoder-Decoder 之间的交叉注意力)、扩展更好(纯粹的堆叠层数),它最终成为了 LLM 的主导架构。
模型规模梯队:从几十亿到上万亿参数
不同的参数量级决定了模型的部署方式和使用场景。选择什么规模的模型,是 AI 工程中的核心决策。
📱 小型模型(0.5B - 8B 参数)手机/笔记本
代表:LLaMA-3.2-1B/3B、Phi-3-mini、Qwen2.5-7B、Gemma-2B
部署:手机、笔记本、树莓派。量化后(INT4)可低至 2-4GB 显存。
能力:简单问答、代码补全、文本分类、摘要。适合特定领域微调后使用。
意义:边缘计算的主力——无需联网,隐私好,延迟极低。
💻 中型模型(13B - 34B 参数)消费级显卡
代表:Mistral 7B/8x7B、LLaMA-3-8B/13B、Yi-34B、Qwen2-14B/32B
部署:单卡/双卡(RTX 4090 24GB 或 A100 40GB)。需 4-bit 量化。
能力:较强的推理、代码生成、多语言能力。适合大多数企业级应用。
意义:性价比最高的区间——能力不错,硬件门槛适中。
🏢 大型模型(70B - 180B 参数)服务器集群
代表:LLaMA-3-70B、Qwen2.5-72B、Mixtral 8x22B、DeepSeek-V2
部署:4-8 块 A100/H100(80GB)。通常使用 8-bit 量化 + Tensor Parallelism。
能力:接近前沿的推理能力、复杂的指令理解、长篇内容生成。适合高要求的商业场景。
意义:目前"好用"与"成本"的最佳平衡点。
🌌 前沿模型(200B+ 参数)超级计算集群
代表:GPT-4(推测约 1.7T MoE)、Claude-3.5(推测约 800B)、Grok-1(314B 稠密)
部署:成百上千块 GPU 进行分布式推理。普通公司无法负担。
能力:目前人类 AI 的巅峰——最复杂的推理、最长的上下文、最小的幻觉率。
意义:前沿探索的引擎——所有中小模型通过蒸馏(Distillation)从这些模型中学习。
开源 vs 闭源:一场影响深远的大模型生态博弈
当前 LLM 世界最火热的话题之一就是"开源还是闭源"。这不仅仅是技术选择,更是商业模式、社区文化、甚至 AI 安全理念的差异。
🌿 开源模型生态
核心理念:模型权重公开,任何人可以下载、部署、微调、研究。
- LLaMA 系列(Meta)— 开源界的标杆。LLaMA-3.1-405B 是当今最强开源模型
- Qwen 系列(阿里)— 中文能力极强,生态完善
- DeepSeek 系列(深度求索)— MoE 先驱,极致性价比
- Mistral 系列(Mistral AI)— 法国新锐,效率优先
- Yi 系列(零一万物)— 李开复带队,双语能力出色
优势:可定制、数据安全、无供应商锁定、社区创新。
挑战:推理成本需要自己承担、部署运维复杂。
☁️ 闭源模型生态
核心理念:通过 API 提供服务,用户无法获取模型权重。
- GPT-4 / GPT-4o(OpenAI)— 综合能力最强,生态最完善
- Claude 3.5(Anthropic)— 安全对齐最佳,长上下文出色
- Gemini 2.0(Google)— 多模态能力领先
- 文心一言 4.0(百度)— 中文场景深耕
- 通义千问 2.5(阿里,有开源版)— 同时走开源和闭源路线
优势:开箱即用、免运维、持续升级、通常更强。
挑战:成本随用量增长、数据隐私风险、供应商锁定。
开源模型正在以惊人的速度缩小与闭源模型的差距。2023 年初,最强开源模型仅相当于 GPT-3.5 的水平;到了 2024 年底,LLaMA-3.1-405B 已经能与 GPT-4 在许多基准上正面竞争。开源不是"劣质"的代名词——它是 AI 民主化的引擎。
—— AI 开源社区的真实写照基础模型(Base Model)vs 微调模型(Chat/Instruct Model)
你下载一个开源模型时,通常会看到两个版本:base 和 chat/instruct。它们有什么区别?
🧪 一个有趣的对比实验
给 Base Model 输入 "User: 什么是梯度下降?\nAssistant:",它不会知道这是在"对话",它只会把这当作"一段文本",然后继续写——可能接着写 "Assistant: 梯度下降是一种..." 也可能写 "User 2: 什么是反向传播?"。而 Chat Model 经过指令微调后,明确知道 "User" 是提问者,"Assistant" 是回答者,它应该以有帮助的助手身份回应。这就是"微调"带来的本质变化。
量化(Quantization):让大模型"瘦身"的魔法
一个 70B 的模型以 FP16(16 位浮点)存储需要 140GB 显存——没有任何一块消费级显卡装得下。量化就是通过降低每个参数占用的比特数来压缩模型。
📦 量化的本质:用更少的比特表示同样的数值
就像用"粗粒度"的尺子量东西——精度降低了,但大致长度还在。量化同理:模型精度略微下降,但体积大幅缩小。
▲ FP16(16位)→ INT8(8位)→ INT4(4位),精度递减但模型体积减半再减半。INT4 量化后的 70B 模型仅需 35GB 显存——单张 4090 即可运行!
🎯 GPTQ
🧩 GGUF / llama.cpp
⚡ AWQ
💨 Bitsandbytes / QLoRA
🔑 本节速记:LLM 的"常识清单"
大语言模型(Large Language Model, LLM)的训练是整个深度学习中最令人兴奋的领域之一。一个LLM从"无"到"有"通常经历以下阶段:
🔤 词元化(Tokenizer)
在训练之前,文本需要先被转换为数字。LLM不使用"字"或"词"作为基本单位,而是使用子词(Subword)。常用算法包括:
- BPE(Byte-Pair Encoding) — GPT系列使用,将高频字节对合并为子词
- WordPiece — BERT使用,基于频率分解为子词单元
- SentencePiece — LLaMA系列使用,语言无关的子词切分(不依赖空格预分词,对中日韩友好)
例如 "unhappiness" 可能被拆分为 ["un", "happi", "ness"] 三个子词。这让模型可以处理未登录词(OOV)。
阶段一:预训练(Pre-training)无监督 · 基础
这是最核心、最耗时的阶段。模型在海量文本数据(数万亿token)上学习语言模式。核心任务是下一个词预测(Next Token Prediction):给定前面所有词,预测下一个最可能的词。
预训练后模型学会了什么?语法、事实知识、推理能力、多语言理解、代码能力、指令跟随雏形——大量 emergent abilities(涌现能力)在预训练阶段就已经出现了。
阶段二:监督微调(SFT)有监督 · 指令
预训练模型虽然掌握了语言,但它只会"续写"文本,不会"回答问题"或"遵循指令"。SFT阶段使用人工编写的高质量指令-回复数据(如InstructPix、Alpaca等数据集),让模型学会以对话形式回应用户。
阶段三:人类偏好对齐强化学习 · 对齐
让模型的回答不仅正确,还要安全、有帮助、符合人类价值观。这是让LLM真正可用的关键一步。主流对齐方法有两种:
🏆 RLHF(基于人类反馈的强化学习)
步骤1:用SFT模型生成多个回复 → 步骤2:人工对回复进行排序 → 步骤3:训练一个"奖励模型(Reward Model)"来预测人类偏好 → 步骤4:用PPO算法微调SFT模型,最大化奖励模型的得分。
这是ChatGPT当年震惊世界的方法。优点:效果好;缺点:训练不稳定、成本高、需要大量人工标注。
✨ DPO(直接偏好优化)
2023年提出的新方法,绕过奖励模型和PPO,直接在偏好数据上优化:让模型的输出分布更偏好"人类喜欢的"回答,同时远离"不喜欢的"回答。
DPO有解析解,训练更稳定、更快、更省资源。如今许多新模型(如LLaMA-3.1)已用DPO替代RLHF。
阶段四:后训练与持续学习持续迭代
模型部署后,会根据实际使用反馈持续优化:
- 持续预训练(Continual Pre-training) — 用更新的数据继续预训练,扩展知识或语言能力
- 领域微调(Domain Adaptation) — 在特定领域(医疗、法律、金融)数据上进一步微调
- 上下文窗口扩展 — 用长文本数据训练,将上下文窗口从4K扩展到128K甚至200K+
推理(Inference)是训练好的模型根据用户输入(prompt)生成回答的过程。这看起来简单——"输入文字,输出文字"——但背后涉及复杂的计算过程和大量工程优化。
自回归生成(Autoregressive Generation)
目前主流LLM采用自回归(自回归= "自我回归")的生成方式:模型一次生成一个词元,然后把新生成的词元追加到输入中,再生成下一个。就像"接龙游戏"。
输入编码
将用户prompt通过Tokenizer转为词元ID序列 [3201, 8923, ...]
Forward Pass
词元序列通过Transformer层,最后一层输出每个位置的词元概率分布
采样/解码
从概率分布中按策略选出一个词元(greedy/top-k/top-p)
追加 & 循环
将选中的词元追加到上下文,回到步骤2,直到生成结束标记
🔬 3D 交互式 LLM 可视化
想直观地看到一个 LLM 从输入到输出的完整内部构造吗?由 Brendan Bycroft 制作的这个 3D 交互式可视化工具,以 GPT-2(small)架构为蓝本,完整展示了 token 嵌入、位置编码、层归一化、自注意力机制、前馈网络和最终的 softmax 输出——所有 Transformer 核心组件均可 3D 交互探索。
▲ 点击上方卡片加载交互式可视化。加载后支持鼠标拖拽旋转视角、滚轮缩放、点击各层展开查看详细结构。建议在桌面端 Chrome/Firefox 上使用,首次加载可能较慢。
解码策略(Decoding Strategies)
模型输出的概率分布可能有数千个候选词元,选哪个词决定了生成的质量。主流策略有:
🎯 Greedy Search(贪婪搜索)
🎲 Sampling(采样)
🔢 Top-k 采样
📊 Nucleus Sampling (top-p)
⚡ 推理的核心优化:KV Cache
在自回归生成中,每一步都需要重新计算之前所有词元的注意力。这非常低效——但注意到,之前词元的Key和Value缓存下来,每一步复用即可。这就是KV Cache。
- 无KV Cache:生成第n个词时,需要重新计算前n-1个词的注意力 → O(n²) 复杂度
- 有KV Cache:每一步只计算新词元的注意力,复用历史KV → 线性复杂度 O(n)
- 128K上下文窗口 + 70B参数模型 → KV Cache大约需要20-40GB显存
深入理解:Q、K、V 到底是什么意思?
在注意力公式 Attention(Q,K,V) = softmax(QK^T / √d)V 中,Q、K、V 分别代表什么?很多教程讲到这里就跳到数学公式,让读者一头雾水。让我们用一个图书馆比喻来理解。
想象你在一座巨大的图书馆里查资料。你手里有一个查询关键词(Q = Query),每本书都有一个目录标签(K = Key),而每本书的正文内容就是(V = Value)。你要做的事情是:用你的查询关键词去比对所有书的目录标签,找到最相关的那些书,然后把它们的内容综合起来作为回答。
—— 注意力机制的图书馆比喻"我想查什么?"
"我是什么?"
"我能提供什么信息?"
🔎 QKV 注意力流程:从查询到加权融合
以句子"那只狗追球,它跑得很快"为例。当模型理解"它"时,会计算它与前面每个词的注意力分数,最终"狗"的 V 被大量提取到"它"的理解中。
▲ 理解"它"时,Q("它")与所有前面词的 K 做匹配。"狗"的 K 与"它"最相关(分数 0.72),所以"狗"的 V 被大量提取到"它"的理解中。
KV Cache 为什么是推理加速的核心?
理解了 QKV 之后,KV Cache 的意义就一目了然了。自回归生成时模型一个字一个字地蹦——每一步都依赖前面的所有 token:
📊 有 KV Cache vs 无 KV Cache 的对比
假设上下文长度是 1000 个 token,需要再生成 50 个 token。
▲ 有 KV Cache 时,每一步只需计算 1 个新 token 的注意力,历史的 K/V 直接读缓存。复杂度从 O(n²) 降到 O(n),推理速度提升 10 倍以上。
🧮 KV Cache 的显存开销
KV Cache 不是免费的午餐。每个 token 都需要保存所有层的 K 和 V。以 LLaMA-3.1-70B 为例(128K 上下文):
进一步加速:PagedAttention 与 FlashAttention
📋 PagedAttention(vLLM)
借鉴操作系统的"虚拟内存分页"思想:将 KV Cache 切成固定大小的"页"(每页存 16 个 token 的 KV),像内存分页一样分散存储、按需分配。
效果:消除内存碎片,KV Cache 内存使用减少 2-3 倍。吞吐对比:比 HuggingFace Transformers 高 24 倍,比 Beam Search 高 3.5 倍。
⚡ FlashAttention
传统 Attention 需要反复从 HBM(高带宽内存)读取 Q、K、V 矩阵做矩阵乘法,带宽是瓶颈。FlashAttention 通过"分块计算 + 重计算"策略,将中间结果存在更快的 SRAM 中,减少 HBM 访问次数。
效果:比 PyTorch 原生 Attention 快 2-4 倍,是目前大多数推理框架的默认选择。
推理加速技术
🚀 量化(Quantization)
🔪 推测解码(Speculative Decoding)
💡 混合专家(MoE)
理解LLM,除了知道它怎么训练和推理,还需要掌握一些关键概念和设计理念。
参数(Parameters)
上下文窗口(Context Window)
涌现能力(Emergent Abilities)
幻觉(Hallucination)
思维链(Chain-of-Thought, CoT)
2022年Google发现:如果在prompt中给出一个示例,示例中包含"逐步推理过程"(如"让我们一步步思考..."),大模型在复杂推理任务上的表现会大幅提升。这就是思维链。
💭 Few-Shot CoT 示例
用户:小明有5个苹果,吃了2个,又买了3包每包4个的饼干,他现在有多少食物?
模型:小明原来有5个苹果... 吃了2个后剩3个... 买了3×4=12个饼干... 总共3+12=15个食物。答案是15。
用户:一个农场有15只鸡,每只鸡每周下3个蛋。如果有5只鸡跑了,剩下的鸡一个月(4周)下多少蛋?
模型:让我们一步步思考... 还剩10只鸡... 每周下10×3=30个蛋... 一个月30×4=120个蛋。答案是120。
RAG(检索增强生成)
模型内部的知识是静态的(训练截止),而现实世界在不断变化。RAG解决这个问题的思路是:不在模型内部存知识,而是每次回答前临时检索相关信息,把检索结果当作prompt的一部分喂给模型。
用户提问
用户输入查询
向量检索
在知识库中查找最相关的文档片段
构造Prompt
将检索结果 + 用户问题 + 指令组装成prompt
模型生成
LLM基于检索内容生成回答
缩放定律(Scaling Laws)
2020年,Kaplan等人发现:模型性能(以损失函数衡量)与参数量、训练数据量、算力三者呈幂律关系。简单来说——模型越大、训练数据越多、算力越强,性能越稳定提升。这一发现指导了后续几乎所有大模型的研发方向。
判断一个大模型不能只看“榜单第几名”。真正有价值的问题是:它能不能在你的任务里稳定、可靠、安全、低成本地完成目标?因此,大模型评估通常要把通用能力、专业能力、事实性、安全性、效率和部署成本放在同一个框架里看。
🧭 一句话标准:好模型 = 能力 × 可靠性 × 成本 × 安全
如果一个模型考试分数很高,但回答经常编造、调用工具不稳定、延迟太高、价格太贵,放到真实业务里依然可能不好用。反过来,一个小模型虽然通用榜单不靠前,但在固定场景中经过微调、RAG 和评测集验证后,可能比大模型更适合落地。
七个维度看清模型强弱
常见评估指标怎么读
1. Accuracy / Exact Match / F1 客观正确性
Accuracy 是答对比例,常用于选择题;Exact Match 要求答案完全一致,常用于短答案;F1 同时考虑精确率和召回率,适合答案有多个片段的问答或信息抽取。
2. pass@k 代码与数学
让模型生成 k 个候选答案,只要其中一个通过单元测试或标准答案,就算通过。HumanEval、MBPP 等代码评测常用它。pass@1 更接近真实用户一次生成的体验,pass@10 更像“多试几次”的上限能力。
3. Win Rate / Elo 人类偏好
两个模型回答同一个问题,由人类或评审模型判断哪一个更好。Chatbot Arena 就使用类似竞技场的方式积累对战结果,再用 Elo 评分估计模型的相对受欢迎程度。
4. Hallucination Rate / Groundedness 事实可靠
幻觉率衡量回答中有多少不被事实或给定资料支持;Groundedness 衡量回答是否忠实于检索资料。在 RAG 系统里,这往往比通用知识分更重要。
5. ASR / Toxicity / Bias 安全风险
ASR(Attack Success Rate) 是越狱或攻击成功率,越低越好;Toxicity 衡量毒性内容;Bias 衡量对性别、地域、职业等群体是否存在系统性偏见。
6. Latency / Throughput / Cost 工程可用
真实产品要看首 token 延迟、总响应时间、并发吞吐、失败率和价格。一个模型如果质量只高 2%,但成本高 5 倍、延迟慢 3 倍,未必是最优选择。
主流 Benchmark 与“国际考试”地图
下面这些评测经常出现在模型技术报告、排行榜和论文中。它们可以帮助横向比较模型,但不能替代你自己的业务评测集。
📚 综合知识
AGIEval:收集高考、SAT、LSAT、GMAT、GRE、公务员、律师资格等公开考试题。
BIG-Bench / BBH:大量非传统任务,常用于观察复杂推理与泛化能力。
🧪 高难科学推理
🧮 数学与竞赛题
MATH:竞赛级数学题,难度明显更高。
AMC / AIME / IMO 风格题:常被用来展示顶级模型的数学上限。
💻 代码与软件工程
LiveCodeBench:用更新、更难污染的编程题降低“背题”影响。
SWE-bench / SWE-bench Verified:让模型修真实 GitHub issue,更接近软件工程实战。
💬 对话偏好
Chatbot Arena:匿名双盲对战,用户选择更好的回答,再汇总为 Elo 分数。
🛡 事实性与安全
HarmBench / RealToxicityPrompts / BOLD:分别关注拒答鲁棒性、毒性生成和偏见表现。
常被引用的国际考试类型
🌐 为什么模型报告喜欢列考试成绩?
人类考试题有明确答案、难度分层清楚、公众更容易理解,所以常被用来展示模型能力。例如 GPT-4 技术报告就列出过律师资格考试、LSAT、SAT、GRE、AP、AMC、USABO、Codeforces 等成绩。但要记住:考试成绩是展示材料,不是完整评估。
- 升学考试:SAT、GRE、GMAT、LSAT、高考等,主要测试语言理解、数学、逻辑和综合知识。
- 职业资格考试:Uniform Bar Exam(美国律师资格考试)、律师资格、公务员考试、医学/金融/会计类资格题等,主要测试专业规则和推理。
- 学科竞赛:AMC、AIME、IMO 风格数学题,USABO 生物奥赛题,Codeforces 编程竞赛题等,主要测试高难推理和问题求解。
- 课程考试:AP 各科、大学本科/研究生课程题、专业医学/法律/计算机题库等,常被整合进 MMLU、AGIEval、C-Eval、CMMLU 等评测集。
看排行榜时最容易踩的坑
训练污染
Prompt 敏感
榜单饱和
不等于业务效果
实战:为自己的场景选模型
定义任务
明确输入、输出、风险、可接受延迟和成本
做黄金集
准备 50-200 条真实样本,覆盖常见与边界情况
统一测试
固定 prompt、温度、工具和上下文,横向比较
错误分析
统计错因:幻觉、格式错、漏召回、拒答不当等
综合决策
用质量、成本、速度、安全和维护性做取舍
📌 小结
榜单适合筛选候选模型,真实评测决定最终选择。专业团队通常会先参考 MMLU、GPQA、HumanEval、SWE-bench、Chatbot Arena 等公开评测,再建立自己的私有评测集,持续跟踪模型版本变化、提示词变化和业务数据漂移。
📎 延伸阅读与资料源
MMLU、HELM、AGIEval、GPT-4 Technical Report、HumanEval、SWE-bench、TruthfulQA、Chatbot Arena 等论文和项目,是理解大模型评估体系的常用入口。
大语言模型的世界广大而深邃。从基础常识到训练推理,从核心概念到评估体系——这一章为你搭建了完整的 LLM 知识框架。
下一章让我们换个视角——探索一种更贴近生物大脑的神经网络:脉冲神经网络(SNN)。