JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

AnchorAI › Computer Vision › Vision Models › ViT

ViT

Vision Transformer

视觉 Transformer

一句话理解

ViT 把图像切成 Patch Token,再用 Transformer 建模它们之间的全局关系。

把一张图切成一串视觉词元,然后像读句子一样理解整张图。

最好理解的例子

一张 224×224 图像按 16×16 切分后得到 196 个 Patch Token,模型像阅读序列一样处理它们。

核心机制

  1. 1

    把图像切成固定大小的 Patch 并线性投影为 Token。

  2. 2

    加入位置编码后送入 Transformer Encoder 建模全局关系。

  3. 3

    汇总输出 Token,得到分类结果或可复用视觉表示。

为什么重要

它把 Transformer 扩展到视觉领域,并成为现代图像识别和多模态模型的重要骨干网络。

关键关系

前置知识

带来能力

快速对比

CNN 通过卷积天然强调局部邻域;ViT 主要依靠数据和 Attention 学习不同 Patch 之间的关系。

常见误解

ViT 的一个 Token 通常对应图像 Patch,而不是单个像素。

知识邻域

AI → Computer Vision → Vision Models