JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

ConceptAI › Deep Learning › Transformer › Self-Attention

Self-Attention

自注意力机制

一句话理解

Self-Attention 让同一序列中的每个 Token 根据其他 Token 更新自己的表示。

最好理解的例子

看到 “river bank” 时,bank 会关注 river,从而更偏向“河岸”而不是“银行”的含义。

核心机制

  1. 1

    同一组输入分别投影为 Q、K、V。

  2. 2

    每个位置用自己的 Q 与全部 K 计算注意力权重。

  3. 3

    按权重聚合全部 V,更新该位置的上下文表示。

为什么重要

它能在一个计算层中建立序列内的全局联系,是 Transformer 获取上下文表示的关键机制。

关键关系

前置知识

强关联

快速对比

Self-Attention 的 Q、K、V 来自同一序列;Cross-Attention 的 Query 与 Key、Value 来自不同序列或模态。

常见误解

Self-Attention 本身并不知道先后顺序,通常还需要位置编码或其他位置机制。

进一步理解

Multi-head Self-Attention 并行使用多组投影,让不同的 head 有机会关注不同类型的关系,最后再合并输出。

知识邻域

AI → Deep Learning → Transformer