Transformer 与 RNN 介绍

2017 年论文《Attention Is All You Need》提出,现在所有大模型(Qwen、混元、GPT)底层全是 Transformer。
核心创新:注意力机制(Self‑Attention 自注意力),抛弃了之前 RNN 循环神经网络。

一、RNN (循环神经网络)

Transformer 出来之前,处理句子、时序数据的主力模型。
核心:循环,一步一步顺序处理,记住上一步的记忆。
以前处理句子,是一个字一字排队读:

比如句子:我 在 深圳 上班
RNN 流程:先读 “我”→记住一点信息,再读 “在”→再读 “深圳”…… 一步步往后走。

缺点:
1.串行,不能并行计算,训练很慢;
2.句子很长的时候,很早前面的文字信息会慢慢忘掉(长距离遗忘)。

举例子:一篇长文章,文章开头提到一个人物,读到结尾,RNN 已经记不住开头这个是谁了。

二、Transformer 核心思想:自注意力 Self‑Attention

一句话:看到每一个词的时候,直接同时看句子里面所有其他词,判断哪些词是重要的,重点关注,不重要的少看。

例子句子:小明把杯子摔了,他很生气
当模型读到【他】这个字:
自注意力会自动计算:

【他】 和谁关系最大?→ 小明,而不是杯子、摔。
于是给「小明」很高权重,给杯子很低权重。
类比人类阅读:读到代词 “他”,眼睛会回头扫前面,找到指代的那个人。 自注意力就是模型的 “回头看” 能力。
✅好处:
1.所有文字同时输入,并行计算,训练速度暴涨;
2.长距离也能建立关联,长文本不容易忘前面信息。

# 简单解释 Q K V(查询、键、值)

可以类比检索:

  - Q 查询:当前这个词,我想要找什么信息(好比你的搜索框输入)
  - K 键:所有词语可以被搜索的索引(好比文档的索引)
  - V 值:真正要拿出来的内容(文档正文)

  1. 拿 Q,和每一个 K 做相似度计算,算出注意力分数;
  2. 分数做 softmax 变成 0‑1 之间权重,越相关分数越高;
  3. 用权重把 V 加权求和,得到这个词融合了全文上下文的新表示。

通俗版:每个词都充当 “搜索者”,同时也充当 “被搜索的资料”。

三、Transformer 两大块:Encoder 编码器 / Decoder 解码器

1. Encoder 编码器(理解)

作用:读懂输入句子,提取上下文信息

输入完整一句话,双向看:一个词既看左边,也看右边全部文字。

代表模型:BERT(做分类、打标、实体抽取)

适合任务:文本分类、打标、实体识别、语义向量。

2. Decoder 解码器(生成)

作用:一个字一个字往下续写文字
只能看已经生成过的前面文字,看不到未来还没生成的字(掩码 mask)。

比如写回答:
用户问:什么是 MCP 模型输出:MCP 全称 Model Context…… 生成 “MCP” 的时候,不到后面 “全称”,只能基于已经输出的内容继续预测下一个 token。

现在绝大多数大模型:只用 Decoder 架构(GPT、Qwen、混元 Pretrain 全部是纯 Decoder)。

3. 工作流程(纯 Decoder 大模型,比如混元‑Pretrain)

1. 文本转 token 数字 id,加上位置编码;
2. 送入多层 decoder;每一层做掩码多头自注意力 + FFN;
3. 最后输出,预测下一个最可能出现的 token;
4. 把预测出来的 token 拼回输入,循环,不断生成下一个字。

预训练阶段就是拿海量文本,反复练习:给定上文,预测下一个字

4.一张极简区分

架构 优点 缺点 适合场景
Encoder+Decoder Encoder 双向深度理解,输入输出分离 需要配对训练数据;参数量大;推理成本高;prompt 灵活性差 翻译、摘要、多模态(图像编码器 + decoder)
纯 Decoder 海量单语数据可训练;Prompt 万能适配;推理简单 KV 缓存成熟 生成时不能偷看未来 token(但输入 prompt 可以完整阅读) 通用大模型:聊天、Agent、RAG、代码、推理(现在主流)

5.通俗总结关键点

1.Transformer 最大功臣是自注意力,可以全局看到全文所有词;
2.RNN 串行慢,Transformer 并行快,所以可以训练万亿 token 大数据;
3. 位置编码告诉模型文字顺序;
4. 现在 LLM 大模型几乎都是纯 Decoder,不断预测下一个 token;
5.BERT 是 Encoder,适合做打标分类,不会生成文字。

常见误区

1. ❌注意力不是 “记住全部内容”,是计算词语之间关联权重;长到超窗口依然会遗忘。
2. ❌多头注意力不是 “多个独立模型”,是同一个模型不同视角提取特征。
3. ❌Transformer 不是只有大模型才有,小 BERT 也是 Transformer。

转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。

文章标题:Transformer 与 RNN 介绍

本文作者:伟生

发布时间:2026-09-08, 21:35:00

最后更新:2026-09-08, 21:50:38

原始链接:http://yoursite.com/2026/09/08/ai_03_Transformer_RNN/

版权声明: "署名-非商用-相同方式共享 4.0" 转载请保留原文链接及作者。

目录
×

喜欢就点赞,疼爱就打赏