JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

ConceptAI › Deep Learning › Transformer › Attention

Attention

注意力机制

一句话理解

Attention 根据当前问题动态判断哪些信息更相关,再按相关程度聚合这些信息。

最好理解的例子

在“球滚下山坡,因为它很圆”中,理解“它”时应更多关注“球”,而不是“山坡”。

核心机制

  1. 1

    由输入生成 Query、Key 与 Value。

  2. 2

    计算 Query 与各 Key 的相关性并归一化为权重。

  3. 3

    按权重汇总 Value,得到与当前问题相关的上下文。

为什么重要

它让模型能按上下文选择信息,并更直接地建立远距离元素之间的联系。

关键关系

前置知识

带来能力

强关联

快速对比

Attention 是一类通用机制;Self-Attention 是其中 Query、Key、Value 来自同一序列的特殊形式。

常见误解

Attention 权重能反映模型的信息聚合方式,但不一定等同于完整、可靠的人类解释。

进一步理解

Scaled dot-product attention 常写作:Attention(Q,K,V)=softmax(QKT/dk)VAttention(Q,K,V)=softmax(QK^T/\sqrt{d_k})V。缩放项用于避免维度较大时点积数值过大。

知识邻域

AI → Deep Learning → Transformer