AnchorAI › Deep Learning › Transformer
Transformer
Transformer Architecture
Transformer 架构
一句话理解
Transformer 是一种以 Attention 为核心、在序列元素之间直接建立关系的神经网络架构。
不再逐词传纸条;每个 Token 都能在一层里直接查看其他 Token。
最好理解的例子
理解长句末尾的代词时,模型可以直接关注句首相关名词,不必把信息逐词传递到末尾。
核心机制
- 1
把输入切成 Token 并加入 Embedding 与位置信息。
- 2
Self-Attention 在 Token 间交换上下文,FFN 对各位置独立变换。
- 3
通过残差、归一化和多层堆叠得到上下文表示或生成输出。
为什么重要
它是大语言模型、Vision Transformer 和许多多模态模型的基础架构。
应用
- 大语言模型
- Vision Transformer
- 多模态表示
- 时间序列建模
相关术语
关键关系
快速对比
RNN 按时间步递归传递隐藏状态;Transformer 在每一层中直接计算 Token 间关系,更适合并行训练。
常见误解
Transformer 能并行处理训练序列,不代表自回归模型生成整段文本时可以完全一次完成。
进一步理解
每一层先在 Token 之间交换信息,再对每个位置独立执行前馈变换。Self-Attention 的计算与序列长度平方相关,因此长上下文模型常需要稀疏注意力、分块或其他优化。
个人思考
Transformer 最值得长期关注的,不只是某个具体模型,而是“把不同类型输入统一成可建立关系的 Token”这一建模方式。
知识邻域
AI → Deep Learning → Transformer