JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

AnchorAI › Deep Learning › Transformer

Transformer

Transformer Architecture

Transformer 架构

一句话理解

Transformer 是一种以 Attention 为核心、在序列元素之间直接建立关系的神经网络架构。

不再逐词传纸条;每个 Token 都能在一层里直接查看其他 Token。

最好理解的例子

理解长句末尾的代词时,模型可以直接关注句首相关名词,不必把信息逐词传递到末尾。

核心机制

  1. 1

    把输入切成 Token 并加入 Embedding 与位置信息。

  2. 2

    Self-Attention 在 Token 间交换上下文,FFN 对各位置独立变换。

  3. 3

    通过残差、归一化和多层堆叠得到上下文表示或生成输出。

为什么重要

它是大语言模型、Vision Transformer 和许多多模态模型的基础架构。

应用

  • 大语言模型
  • Vision Transformer
  • 多模态表示
  • 时间序列建模

相关术语

关键关系

前置知识

带来能力

对比

快速对比

RNN 按时间步递归传递隐藏状态;Transformer 在每一层中直接计算 Token 间关系,更适合并行训练。

常见误解

Transformer 能并行处理训练序列,不代表自回归模型生成整段文本时可以完全一次完成。

进一步理解

每一层先在 Token 之间交换信息,再对每个位置独立执行前馈变换。Self-Attention 的计算与序列长度平方相关,因此长上下文模型常需要稀疏注意力、分块或其他优化。

个人思考

Transformer 最值得长期关注的,不只是某个具体模型,而是“把不同类型输入统一成可建立关系的 Token”这一建模方式。

知识邻域

AI → Deep Learning → Transformer