主题色
250
壁纸模式
壁纸设置
特效设置
固定导航栏
字体选择
文章列表布局
5334 字
14 分钟
AI 简史:理解大语言模型的六个转折
2026-03-15

今天的大语言模型不是由某个单一发明突然造出来的。规则系统、统计语言模型、神经网络、Transformer 和人类反馈训练,分别解决了前一阶段暴露出的不同问题。

这篇文章不是完整的人工智能史,而是一条为理解大语言模型筛选过的主线。读完以后,至少应该能回答三个问题:模型为什么从人工规则转向数据学习,Transformer 改变了什么,以及模型规模之外还有哪些关键变量。

先看全景。表中的年代彼此重叠,因为新方法通常会吸收旧方法,而不是在某一天将其彻底取代。

阶段核心做法解决的问题留下的问题
规则系统人工编写模式和知识让机器在明确边界内执行推理规则难以覆盖现实世界
统计语言模型从语料统计词序列概率不再逐条手写语言规则数据稀疏,上下文很短
分布式表示与序列网络学习词向量和隐藏状态相似词可以共享信息,序列可以携带上下文静态词义、长依赖和顺序计算
注意力与 Transformer直接计算序列位置之间的关系改善长距离信息交互,并行训练更高效注意力成本随序列长度快速增长
预训练、扩展与指令对齐先学习通用模式,再适配任务和人类偏好一个模型可以处理多类任务成本、可靠性和可控性
多模态与推理时计算接入更多模态,并在回答前分配更多计算扩大输入输出范围,提升部分复杂任务表现评估、幻觉、延迟和安全边界

一、规则系统:能力来自人写下来的知识#

早期语言程序的直接思路,是把人的判断写成规则。程序能够解释哪些输入、做出哪些回答,取决于开发者提前覆盖了多少情况。

1.1 ELIZA 展示了模式匹配的力量与边界#

Joseph Weizenbaum 在 1966 年发表了 ELIZA。它是早期最有影响力的对话程序之一,但不宜简单称为“历史上第一个聊天机器人”。“聊天机器人”是后来形成的分类,而早期人机对话研究还有其他并行工作。

ELIZA 最著名的 DOCTOR 脚本会寻找关键词、转换人称,再从模板中选择回复。例如,用户输入“我很难过”,程序可以根据“难过”触发“为什么你会难过?”之类的模板。它生成了对话的外观,却没有建立对“难过”的世界知识或心理状态模型。

ELIZA 的历史意义不只在算法。用户可能从连贯语言中推断出程序并不具备的理解和人格,这种倾向后来常被称为“ELIZA 效应”。直到今天,流畅表达仍然容易被误认为事实可靠、推理正确或具有主观感受。

1.2 专家系统把规则扩展到专业判断#

20 世纪 70 至 80 年代,专家系统尝试把专业知识编码为规则库。例如,MYCIN 用规则和置信度处理细菌感染诊断问题。它证明了一个重要事实:在范围明确、知识可以表达成规则的领域,符号系统能够完成有价值的推理。

瓶颈也很明确。专家的隐性经验很难完整写入规则库,规则之间还会出现冲突。领域、术语或流程一旦变化,维护者就要持续更新知识库。这通常被概括为“知识获取瓶颈”。

规则系统并没有消失。税务校验、合规策略和工作流引擎仍然大量使用规则。变化在于,人们不再期待仅靠规则覆盖开放语言和常识世界。

二、统计学习:从写规则转向从语料计数#

统计语言模型不再规定每句话应该如何解析,而是估计一段词序列出现的概率。这个转变把能力来源从“程序员写了什么”改成“训练数据中出现了什么规律”。

2.1 N-gram 用有限历史预测下一个词#

N-gram 假设下一个词主要取决于前面有限的几个词。下面的式子展示二元模型如何从计数得到条件概率,重点是它只查看一个前词。

P(好 | 天气) = count(天气 好) / count(天气)

如果语料中“天气”出现 10,000 次,其中 3,000 次后面紧跟“好”,那么这个估计值就是 0.3。实际系统还需要平滑等技术,避免没见过的组合直接得到零概率。

N-gram 的优势是简单、可解释,在输入法、语音识别和机器翻译中长期发挥过作用。它的局限来自固定窗口和组合数量:窗口加长后,可能的词序列迅速增加,大多数又不会在有限语料中出现。

2.2 词向量让相似词共享统计信息#

神经网络语言模型和分布式表示提供了另一种办法:不再把每个词当成互不相关的编号,而是学习一组连续数值。用法相近的词可以在向量空间中靠近,从而共享统计信息。

词向量并非始于 Word2Vec。2003 年的神经概率语言模型已经联合学习词表示和语言模型。2013 年,Mikolov 等人提出的 Word2Vec 让大规模词向量训练更高效,也让这类表示广泛普及。

“国王 - 男人 + 女人 ≈ 王后”是常见演示,但它不是模型理解了王权或性别。它表示训练语料中的部分关系能以几何方向呈现,而且结果会受数据、语言和具体算法影响。

Word2Vec 还属于静态词向量:同一个词只有一个主要表示,难以区分“苹果很好吃”和“苹果发布新产品”里的不同含义。上下文相关的表示,需要序列模型和后来的 Transformer 继续解决。

三、序列模型:让表示随上下文变化#

这里需要纠正一条常见但错误的时间线:不是 Word2Vec 发明以后才出现 RNN,再由 RNN 发明 LSTM。循环神经网络的研究更早,LSTM 在 1997 年已经发表;Word2Vec 则在 2013 年出现。它们在 2010 年代共同推动了神经网络自然语言处理的发展。

3.1 RNN 与 LSTM 用状态传递上下文#

循环神经网络(RNN)按顺序读取输入,并把上一步的隐藏状态传给下一步。下面的简式用于说明状态如何递推,不代表某个完整模型实现。

h_t = f(x_t, h_{t-1})

其中,x_t 是当前位置的输入,h_{t-1} 是此前信息形成的状态,h_t 是更新后的状态。与固定窗口相比,这种结构理论上可以携带更长的上下文。

普通 RNN 在训练长依赖时容易遇到梯度消失或梯度爆炸。LSTM 用门控和记忆单元改善误差信号与信息的传递,因此在语音识别、翻译和文本生成中得到广泛应用。它缓解了长依赖问题,并没有让网络获得无限记忆。

另一个限制来自计算顺序。第 t 步依赖第 t-1 步,训练时很难把同一序列的所有位置完全并行处理。

3.2 Seq2Seq 统一了序列转换#

2014 年的 Sequence to Sequence Learning 用一个 LSTM 编码输入,再由另一个 LSTM 生成输出。翻译、摘要和对话都可以表述为“输入序列到输出序列”,不再需要为每项任务手工拼装完全不同的流水线。

早期 Seq2Seq 需要把整段输入压进固定长度的向量。输入越长,单一向量越难保留全部细节。注意力机制由此成为关键补充。

3.3 注意力让解码器按需查看输入#

Bahdanau 等人在 2014 年提交的神经机器翻译论文中,让解码器生成每个词时,对输入各位置计算不同权重。生成译文中的“狐狸”时,模型可以把更多权重放在原文的“fox”上,而不是只依赖一个固定长度向量。

注意力不是人类目光或意识的数学复刻。它是一种可学习的加权计算,用来决定当前步骤应组合哪些表示。

四、Transformer:把注意力变成主干#

2017 年的 《Attention Is All You Need》提出 Transformer,在原始机器翻译架构中不再使用循环层和卷积层,而是用注意力、前馈网络、残差连接和位置编码构成编码器与解码器。

下面这张图只展示自注意力的信息流,帮助理解“一个位置如何组合其他位置的信息”,省略了多头、归一化和前馈网络等结构。

flowchart LR A[输入 token 及位置信息] --> B[生成 Query Key Value] B --> C[计算位置之间的相关分数] C --> D[归一化为注意力权重] D --> E[加权组合 Value] E --> F[得到上下文相关表示]

图中的关键变化是:一个位置不必让信息沿着循环状态逐步传递,可以直接与序列中的其他可见位置建立联系。同一个词在不同句子里也会得到不同表示。

Transformer 带来两项影响深远的工程优势:

  • 训练更容易并行:已知完整训练序列时,多个位置的注意力计算可以并行执行,更适合 GPU 和 TPU。
  • 信息路径更短:远距离位置可以直接交互,不必经过许多循环步骤。

这些优势都有边界。标准自注意力的计算量和显存占用会随序列长度近似平方增长;自回归模型在生成时仍要逐 token 产生输出。因此,“Transformer 没有距离限制”或“所有计算都能并行”都不准确。

原论文同时包含编码器和解码器。后来出现了偏重不同任务的路线:BERT 使用编码器式架构学习双向表示,GPT 系列主要使用带因果掩码的解码器逐 token 生成文本。今天的“大语言模型”通常指后一类生成模型,但 Transformer 的应用远不止聊天。

五、预训练、扩展与指令对齐#

Transformer 提供了可扩展架构,预训练则改变了模型的使用方式:先从大规模数据中学习通用表示,再通过微调、提示或其他后训练方法适配任务。

5.1 一个模型开始承担多类任务#

2018 年,OpenAI 的生成式预训练工作展示了“语言模型预训练 + 任务微调”;同年的 BERT使用掩码语言建模学习双向表示。它们不是预训练思想的起点,却让 Transformer 预训练成为自然语言处理的主流范式。

2020 年的 GPT-3进一步展示了上下文学习:模型参数不更新,只在提示中给出任务描述或少量示例,也能完成多种任务。上下文学习不是现场重新训练模型,而是模型根据当前输入调整输出行为。

5.2 规模有效,但“越大越聪明”过于简单#

缩放定律研究观察到,语言模型的训练损失会随参数量、数据量和计算量呈现较平滑的规律。后续 Chinchilla 等工作又说明,在固定计算预算下,参数量与训练数据需要合理配比。模型大小只是变量之一,数据质量、训练目标、后训练和推理预算同样重要。

“涌现能力”也需要谨慎描述。2022 年的一项研究把某些在较大模型上才观察到的能力称为涌现;另一项研究指出,部分突变可能来自非连续评价指标,改用连续指标后会呈现渐进变化。因此,不能把“达到某个参数阈值后突然学会推理”写成已经确定的普遍规律。

5.3 指令对齐把语言模型变成对话产品的核心#

仅靠下一个 token 预测,模型不一定会理解用户是在提问、下命令,还是要求遵守格式。指令微调让模型学习“什么样的请求对应什么样的回答”,基于人类反馈的强化学习(RLHF)则利用人类偏好数据继续调整行为。

2022 年的 InstructGPT 论文展示了一个典型流程:收集人工示范做监督微调,再收集回答排序训练奖励模型,最后用强化学习优化策略。ChatGPT 的大众影响来自模型、对齐方法、对话界面和服务工程的组合,而不是 RLHF 单项技术突然创造了全部能力。

对齐也不是“给模型加上正确价值观”这么简单。偏好数据可能带来迎合用户、回避问题或过度拒答等行为,模型仍然需要持续评估。

六、2022 年以后:能力扩展到新的维度#

进入大模型阶段后,进展不再只有“增加参数”一条路线。到 2024 至 2026 年,更值得关注的是开放权重、多模态、推理时计算和效率优化。这些方向仍在快速变化,具体产品排名和型号很容易过时,因此这里只讨论稳定的技术转折。

6.1 开放权重扩大了研究与部署空间#

Llama、Mistral、Qwen、DeepSeek 等模型系列让开发者可以下载权重,在本地推理、微调或研究模型行为。它们降低了进入门槛,也推动了量化、推理框架和领域模型的发展。

“开放权重”和“开源”不能直接画等号。判断一个模型的开放程度,至少要分别查看权重、代码、训练数据、训练方法和许可证。以 Llama 2 为例,Meta 发布了权重和代码,但使用受其社区许可证约束。不同模型的开放范围并不相同。

开放权重也不自动意味着更安全、更准确或没有隐私风险。部署方仍需承担数据治理、评估、更新和运行成本。

6.2 多模态把统一接口扩展到图像、音频和视频#

多模态模型早于 2024 年已经存在。例如,2022 年的 Flamingo能够处理交错的图像、视频和文本。2024 年前后,文本、视觉和音频在同一模型中的端到端处理进一步进入大众产品。

这并不意味着模型以与人相同的方式“看见”或“听见”世界。它表示不同模态被编码到可联合训练和生成的表示中。新增模态还会引入新的错误类型,例如图像细节误读、语音转写偏差和跨模态幻觉。

6.3 推理时计算为复杂任务分配更多步骤#

传统自回归模型也可以生成中间步骤,但 2024 年后的推理模型更系统地通过后训练和额外推理计算改善数学、代码等任务。OpenAI 的 o1和开放权重的 DeepSeek-R1是这一方向的代表。

“想得更久”不是普遍有效的保证。更多采样、搜索或推理 token 会增加延迟与成本,在简单任务上可能没有收益。模型展示出来的推理文字也不必然等于其内部计算的忠实解释,不能仅凭一段流畅的“思考过程”判断答案正确。

6.4 效率重新成为核心变量#

混合专家模型(MoE)每次只激活部分参数,蒸馏把较大模型的部分能力迁移到较小模型,量化用更低精度保存和计算权重。这些方法共同说明,参数总量不能单独代表每次推理的成本,更不能单独代表实际效果。

对于真实应用,延迟、显存、吞吐、上下文长度和任务准确率需要一起衡量。能在目标硬件上稳定完成任务的小模型,可能比基准分数更高的大模型更合适。

七、理解今天的大语言模型,需要保留哪些边界#

沿着这条历史主线,可以得到四个比“模型越来越大”更稳固的结论。

  1. 能力来源从人工规则转向可学习表示。 人不再逐条编写语言规则,但仍在选择数据、目标函数、模型架构和反馈方式。
  2. 架构决定计算路径,不等于消除所有旧问题。 Transformer 改善了并行训练和长距离交互,仍受有限上下文、注意力成本和自回归生成速度约束。
  3. 产品能力不等于基础模型能力。 检索、工具调用、记忆、权限系统和交互界面都会改变用户看到的结果。
  4. 流畅不等于可靠。 模型会生成事实错误、错误推理和虚构引用,重要任务仍需外部证据与验证机制。

“大模型是否真正理解语言”目前没有统一答案。把它简单说成“只是在查表”不准确,因为模型确实会学习可迁移的内部表示;把流畅输出直接当作人类式理解也缺少证据。更实用的做法是把“理解”拆成可测试的能力:能否在新表述下保持结论,能否组合已有知识,能否识别信息不足,能否在分布变化后仍然可靠。

模型在普通推理过程中通常不会直接更新权重,所以权重中的知识有训练截止范围。但产品可以通过检索、工具、外部记忆或后续微调接入新信息。这里同样要区分模型和完整系统。

下面的时间线用于回顾关键转折。它只标记本文主线,不表示每个阶段在标注年份结束。

timeline title 通向大语言模型的关键转折 1966 : ELIZA 论文发表 : 模式匹配形成对话外观 1970s-1980s : 专家系统发展 : 专业知识进入规则库 1980s-2000s : 统计语言模型广泛应用 : 从语料估计序列概率 1997 : LSTM 发表 : 改善长依赖训练 2003-2013 : 神经语言模型与词向量 : 从离散符号转向分布式表示 2014 : Seq2Seq 与神经注意力 : 统一序列转换并按需查看输入 2017 : Transformer : 注意力成为架构主干 2018-2020 : GPT BERT 与 GPT-3 : 预训练和上下文学习扩展任务范围 2022 : InstructGPT 与 ChatGPT : 指令对齐和对话产品走向大众 2022-2024 : 开放权重与多模态发展 : 模型进入更多部署环境和信息形式 2024-2025 : 推理时计算受到重视 : 后训练和额外计算改善部分复杂任务

这条历史并不是“新模型消灭旧模型”。规则适合明确约束,统计模型适合可解释基线,序列网络仍用于特定时序任务,Transformer 则成为当前大语言模型的主要骨架。真正的变化,是系统不断把更多能力从手工设计迁移到数据学习,同时把新的成本和风险推到基础设施、评估与治理层。

参考资料#

支持与分享

如果这篇文章对你有帮助,欢迎支持作者或分享给更多人

赞助
AI 简史:理解大语言模型的六个转折
https://blog.souloss.cn/posts/ai/llm-basics/ai-history/
作者
Tsukimi
发布于
2026-03-15
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时