今天的大语言模型不是由某个单一发明突然造出来的。规则系统、统计语言模型、神经网络、Transformer 和人类反馈训练,分别解决了前一阶段暴露出的不同问题。
这篇文章不是完整的人工智能史,而是一条为理解大语言模型筛选过的主线。读完以后,至少应该能回答三个问题:模型为什么从人工规则转向数据学习,Transformer 改变了什么,以及模型规模之外还有哪些关键变量。
先看全景。表中的年代彼此重叠,因为新方法通常会吸收旧方法,而不是在某一天将其彻底取代。
| 阶段 | 核心做法 | 解决的问题 | 留下的问题 |
|---|---|---|---|
| 规则系统 | 人工编写模式和知识 | 让机器在明确边界内执行推理 | 规则难以覆盖现实世界 |
| 统计语言模型 | 从语料统计词序列概率 | 不再逐条手写语言规则 | 数据稀疏,上下文很短 |
| 分布式表示与序列网络 | 学习词向量和隐藏状态 | 相似词可以共享信息,序列可以携带上下文 | 静态词义、长依赖和顺序计算 |
| 注意力与 Transformer | 直接计算序列位置之间的关系 | 改善长距离信息交互,并行训练更高效 | 注意力成本随序列长度快速增长 |
| 预训练、扩展与指令对齐 | 先学习通用模式,再适配任务和人类偏好 | 一个模型可以处理多类任务 | 成本、可靠性和可控性 |
| 多模态与推理时计算 | 接入更多模态,并在回答前分配更多计算 | 扩大输入输出范围,提升部分复杂任务表现 | 评估、幻觉、延迟和安全边界 |
一、规则系统:能力来自人写下来的知识
早期语言程序的直接思路,是把人的判断写成规则。程序能够解释哪些输入、做出哪些回答,取决于开发者提前覆盖了多少情况。
1.1 ELIZA 展示了模式匹配的力量与边界
Joseph Weizenbaum 在 1966 年发表了 ELIZA。它是早期最有影响力的对话程序之一,但不宜简单称为“历史上第一个聊天机器人”。“聊天机器人”是后来形成的分类,而早期人机对话研究还有其他并行工作。
ELIZA 最著名的 DOCTOR 脚本会寻找关键词、转换人称,再从模板中选择回复。例如,用户输入“我很难过”,程序可以根据“难过”触发“为什么你会难过?”之类的模板。它生成了对话的外观,却没有建立对“难过”的世界知识或心理状态模型。
ELIZA 的历史意义不只在算法。用户可能从连贯语言中推断出程序并不具备的理解和人格,这种倾向后来常被称为“ELIZA 效应”。直到今天,流畅表达仍然容易被误认为事实可靠、推理正确或具有主观感受。
1.2 专家系统把规则扩展到专业判断
20 世纪 70 至 80 年代,专家系统尝试把专业知识编码为规则库。例如,MYCIN 用规则和置信度处理细菌感染诊断问题。它证明了一个重要事实:在范围明确、知识可以表达成规则的领域,符号系统能够完成有价值的推理。
瓶颈也很明确。专家的隐性经验很难完整写入规则库,规则之间还会出现冲突。领域、术语或流程一旦变化,维护者就要持续更新知识库。这通常被概括为“知识获取瓶颈”。
规则系统并没有消失。税务校验、合规策略和工作流引擎仍然大量使用规则。变化在于,人们不再期待仅靠规则覆盖开放语言和常识世界。
二、统计学习:从写规则转向从语料计数
统计语言模型不再规定每句话应该如何解析,而是估计一段词序列出现的概率。这个转变把能力来源从“程序员写了什么”改成“训练数据中出现了什么规律”。
2.1 N-gram 用有限历史预测下一个词
N-gram 假设下一个词主要取决于前面有限的几个词。下面的式子展示二元模型如何从计数得到条件概率,重点是它只查看一个前词。
P(好 | 天气) = count(天气 好) / count(天气)如果语料中“天气”出现 10,000 次,其中 3,000 次后面紧跟“好”,那么这个估计值就是 0.3。实际系统还需要平滑等技术,避免没见过的组合直接得到零概率。
N-gram 的优势是简单、可解释,在输入法、语音识别和机器翻译中长期发挥过作用。它的局限来自固定窗口和组合数量:窗口加长后,可能的词序列迅速增加,大多数又不会在有限语料中出现。
2.2 词向量让相似词共享统计信息
神经网络语言模型和分布式表示提供了另一种办法:不再把每个词当成互不相关的编号,而是学习一组连续数值。用法相近的词可以在向量空间中靠近,从而共享统计信息。
词向量并非始于 Word2Vec。2003 年的神经概率语言模型已经联合学习词表示和语言模型。2013 年,Mikolov 等人提出的 Word2Vec 让大规模词向量训练更高效,也让这类表示广泛普及。
“国王 - 男人 + 女人 ≈ 王后”是常见演示,但它不是模型理解了王权或性别。它表示训练语料中的部分关系能以几何方向呈现,而且结果会受数据、语言和具体算法影响。
Word2Vec 还属于静态词向量:同一个词只有一个主要表示,难以区分“苹果很好吃”和“苹果发布新产品”里的不同含义。上下文相关的表示,需要序列模型和后来的 Transformer 继续解决。
三、序列模型:让表示随上下文变化
这里需要纠正一条常见但错误的时间线:不是 Word2Vec 发明以后才出现 RNN,再由 RNN 发明 LSTM。循环神经网络的研究更早,LSTM 在 1997 年已经发表;Word2Vec 则在 2013 年出现。它们在 2010 年代共同推动了神经网络自然语言处理的发展。
3.1 RNN 与 LSTM 用状态传递上下文
循环神经网络(RNN)按顺序读取输入,并把上一步的隐藏状态传给下一步。下面的简式用于说明状态如何递推,不代表某个完整模型实现。
h_t = f(x_t, h_{t-1})其中,x_t 是当前位置的输入,h_{t-1} 是此前信息形成的状态,h_t 是更新后的状态。与固定窗口相比,这种结构理论上可以携带更长的上下文。
普通 RNN 在训练长依赖时容易遇到梯度消失或梯度爆炸。LSTM 用门控和记忆单元改善误差信号与信息的传递,因此在语音识别、翻译和文本生成中得到广泛应用。它缓解了长依赖问题,并没有让网络获得无限记忆。
另一个限制来自计算顺序。第 t 步依赖第 t-1 步,训练时很难把同一序列的所有位置完全并行处理。
3.2 Seq2Seq 统一了序列转换
2014 年的 Sequence to Sequence Learning 用一个 LSTM 编码输入,再由另一个 LSTM 生成输出。翻译、摘要和对话都可以表述为“输入序列到输出序列”,不再需要为每项任务手工拼装完全不同的流水线。
早期 Seq2Seq 需要把整段输入压进固定长度的向量。输入越长,单一向量越难保留全部细节。注意力机制由此成为关键补充。
3.3 注意力让解码器按需查看输入
Bahdanau 等人在 2014 年提交的神经机器翻译论文中,让解码器生成每个词时,对输入各位置计算不同权重。生成译文中的“狐狸”时,模型可以把更多权重放在原文的“fox”上,而不是只依赖一个固定长度向量。
注意力不是人类目光或意识的数学复刻。它是一种可学习的加权计算,用来决定当前步骤应组合哪些表示。
四、Transformer:把注意力变成主干
2017 年的 《Attention Is All You Need》提出 Transformer,在原始机器翻译架构中不再使用循环层和卷积层,而是用注意力、前馈网络、残差连接和位置编码构成编码器与解码器。
下面这张图只展示自注意力的信息流,帮助理解“一个位置如何组合其他位置的信息”,省略了多头、归一化和前馈网络等结构。
图中的关键变化是:一个位置不必让信息沿着循环状态逐步传递,可以直接与序列中的其他可见位置建立联系。同一个词在不同句子里也会得到不同表示。
Transformer 带来两项影响深远的工程优势:
- 训练更容易并行:已知完整训练序列时,多个位置的注意力计算可以并行执行,更适合 GPU 和 TPU。
- 信息路径更短:远距离位置可以直接交互,不必经过许多循环步骤。
这些优势都有边界。标准自注意力的计算量和显存占用会随序列长度近似平方增长;自回归模型在生成时仍要逐 token 产生输出。因此,“Transformer 没有距离限制”或“所有计算都能并行”都不准确。
原论文同时包含编码器和解码器。后来出现了偏重不同任务的路线:BERT 使用编码器式架构学习双向表示,GPT 系列主要使用带因果掩码的解码器逐 token 生成文本。今天的“大语言模型”通常指后一类生成模型,但 Transformer 的应用远不止聊天。
五、预训练、扩展与指令对齐
Transformer 提供了可扩展架构,预训练则改变了模型的使用方式:先从大规模数据中学习通用表示,再通过微调、提示或其他后训练方法适配任务。
5.1 一个模型开始承担多类任务
2018 年,OpenAI 的生成式预训练工作展示了“语言模型预训练 + 任务微调”;同年的 BERT使用掩码语言建模学习双向表示。它们不是预训练思想的起点,却让 Transformer 预训练成为自然语言处理的主流范式。
2020 年的 GPT-3进一步展示了上下文学习:模型参数不更新,只在提示中给出任务描述或少量示例,也能完成多种任务。上下文学习不是现场重新训练模型,而是模型根据当前输入调整输出行为。
5.2 规模有效,但“越大越聪明”过于简单
缩放定律研究观察到,语言模型的训练损失会随参数量、数据量和计算量呈现较平滑的规律。后续 Chinchilla 等工作又说明,在固定计算预算下,参数量与训练数据需要合理配比。模型大小只是变量之一,数据质量、训练目标、后训练和推理预算同样重要。
“涌现能力”也需要谨慎描述。2022 年的一项研究把某些在较大模型上才观察到的能力称为涌现;另一项研究指出,部分突变可能来自非连续评价指标,改用连续指标后会呈现渐进变化。因此,不能把“达到某个参数阈值后突然学会推理”写成已经确定的普遍规律。
5.3 指令对齐把语言模型变成对话产品的核心
仅靠下一个 token 预测,模型不一定会理解用户是在提问、下命令,还是要求遵守格式。指令微调让模型学习“什么样的请求对应什么样的回答”,基于人类反馈的强化学习(RLHF)则利用人类偏好数据继续调整行为。
2022 年的 InstructGPT 论文展示了一个典型流程:收集人工示范做监督微调,再收集回答排序训练奖励模型,最后用强化学习优化策略。ChatGPT 的大众影响来自模型、对齐方法、对话界面和服务工程的组合,而不是 RLHF 单项技术突然创造了全部能力。
对齐也不是“给模型加上正确价值观”这么简单。偏好数据可能带来迎合用户、回避问题或过度拒答等行为,模型仍然需要持续评估。
六、2022 年以后:能力扩展到新的维度
进入大模型阶段后,进展不再只有“增加参数”一条路线。到 2024 至 2026 年,更值得关注的是开放权重、多模态、推理时计算和效率优化。这些方向仍在快速变化,具体产品排名和型号很容易过时,因此这里只讨论稳定的技术转折。
6.1 开放权重扩大了研究与部署空间
Llama、Mistral、Qwen、DeepSeek 等模型系列让开发者可以下载权重,在本地推理、微调或研究模型行为。它们降低了进入门槛,也推动了量化、推理框架和领域模型的发展。
“开放权重”和“开源”不能直接画等号。判断一个模型的开放程度,至少要分别查看权重、代码、训练数据、训练方法和许可证。以 Llama 2 为例,Meta 发布了权重和代码,但使用受其社区许可证约束。不同模型的开放范围并不相同。
开放权重也不自动意味着更安全、更准确或没有隐私风险。部署方仍需承担数据治理、评估、更新和运行成本。
6.2 多模态把统一接口扩展到图像、音频和视频
多模态模型早于 2024 年已经存在。例如,2022 年的 Flamingo能够处理交错的图像、视频和文本。2024 年前后,文本、视觉和音频在同一模型中的端到端处理进一步进入大众产品。
这并不意味着模型以与人相同的方式“看见”或“听见”世界。它表示不同模态被编码到可联合训练和生成的表示中。新增模态还会引入新的错误类型,例如图像细节误读、语音转写偏差和跨模态幻觉。
6.3 推理时计算为复杂任务分配更多步骤
传统自回归模型也可以生成中间步骤,但 2024 年后的推理模型更系统地通过后训练和额外推理计算改善数学、代码等任务。OpenAI 的 o1和开放权重的 DeepSeek-R1是这一方向的代表。
“想得更久”不是普遍有效的保证。更多采样、搜索或推理 token 会增加延迟与成本,在简单任务上可能没有收益。模型展示出来的推理文字也不必然等于其内部计算的忠实解释,不能仅凭一段流畅的“思考过程”判断答案正确。
6.4 效率重新成为核心变量
混合专家模型(MoE)每次只激活部分参数,蒸馏把较大模型的部分能力迁移到较小模型,量化用更低精度保存和计算权重。这些方法共同说明,参数总量不能单独代表每次推理的成本,更不能单独代表实际效果。
对于真实应用,延迟、显存、吞吐、上下文长度和任务准确率需要一起衡量。能在目标硬件上稳定完成任务的小模型,可能比基准分数更高的大模型更合适。
七、理解今天的大语言模型,需要保留哪些边界
沿着这条历史主线,可以得到四个比“模型越来越大”更稳固的结论。
- 能力来源从人工规则转向可学习表示。 人不再逐条编写语言规则,但仍在选择数据、目标函数、模型架构和反馈方式。
- 架构决定计算路径,不等于消除所有旧问题。 Transformer 改善了并行训练和长距离交互,仍受有限上下文、注意力成本和自回归生成速度约束。
- 产品能力不等于基础模型能力。 检索、工具调用、记忆、权限系统和交互界面都会改变用户看到的结果。
- 流畅不等于可靠。 模型会生成事实错误、错误推理和虚构引用,重要任务仍需外部证据与验证机制。
“大模型是否真正理解语言”目前没有统一答案。把它简单说成“只是在查表”不准确,因为模型确实会学习可迁移的内部表示;把流畅输出直接当作人类式理解也缺少证据。更实用的做法是把“理解”拆成可测试的能力:能否在新表述下保持结论,能否组合已有知识,能否识别信息不足,能否在分布变化后仍然可靠。
模型在普通推理过程中通常不会直接更新权重,所以权重中的知识有训练截止范围。但产品可以通过检索、工具、外部记忆或后续微调接入新信息。这里同样要区分模型和完整系统。
下面的时间线用于回顾关键转折。它只标记本文主线,不表示每个阶段在标注年份结束。
这条历史并不是“新模型消灭旧模型”。规则适合明确约束,统计模型适合可解释基线,序列网络仍用于特定时序任务,Transformer 则成为当前大语言模型的主要骨架。真正的变化,是系统不断把更多能力从手工设计迁移到数据学习,同时把新的成本和风险推到基础设施、评估与治理层。
参考资料
- Joseph Weizenbaum, ELIZA—a computer program for the study of natural language communication between man and machine, 1966
- Yoshua Bengio 等, A Neural Probabilistic Language Model, 2003
- Tomas Mikolov 等, Efficient Estimation of Word Representations in Vector Space, 2013
- Sepp Hochreiter、Jürgen Schmidhuber, Long Short-Term Memory, 1997
- Ilya Sutskever 等, Sequence to Sequence Learning with Neural Networks, 2014
- Dzmitry Bahdanau 等, Neural Machine Translation by Jointly Learning to Align and Translate, 2014
- Ashish Vaswani 等, Attention Is All You Need, 2017
- Alec Radford 等, Improving Language Understanding by Generative Pre-Training, 2018
- Jacob Devlin 等, BERT, 2018
- Tom Brown 等, Language Models are Few-Shot Learners, 2020
- Long Ouyang 等, Training language models to follow instructions with human feedback, 2022
- Jason Wei 等, Emergent Abilities of Large Language Models, 2022
- Rylan Schaeffer 等, Are Emergent Abilities of Large Language Models a Mirage?, 2023
- Jean-Baptiste Alayrac 等, Flamingo, 2022
- DeepSeek-AI, DeepSeek-R1, 2025
支持与分享
如果这篇文章对你有帮助,欢迎支持作者或分享给更多人
部分信息可能已经过时








