ConceptAI › Deep Learning › Transformer › Self-Attention
Self-Attention
自注意力机制
一句话理解
Self-Attention 让同一序列中的每个 Token 根据其他 Token 更新自己的表示。
最好理解的例子
看到 “river bank” 时,bank 会关注 river,从而更偏向“河岸”而不是“银行”的含义。
核心机制
- 1
同一组输入分别投影为 Q、K、V。
- 2
每个位置用自己的 Q 与全部 K 计算注意力权重。
- 3
按权重聚合全部 V,更新该位置的上下文表示。
为什么重要
它能在一个计算层中建立序列内的全局联系,是 Transformer 获取上下文表示的关键机制。
关键关系
前置知识
强关联
快速对比
Self-Attention 的 Q、K、V 来自同一序列;Cross-Attention 的 Query 与 Key、Value 来自不同序列或模态。
常见误解
Self-Attention 本身并不知道先后顺序,通常还需要位置编码或其他位置机制。
进一步理解
Multi-head Self-Attention 并行使用多组投影,让不同的 head 有机会关注不同类型的关系,最后再合并输出。
知识邻域
AI → Deep Learning → Transformer