AnchorAI › Computer Vision › Vision Models › ViT
ViT
Vision Transformer
视觉 Transformer
一句话理解
ViT 把图像切成 Patch Token,再用 Transformer 建模它们之间的全局关系。
把一张图切成一串视觉词元,然后像读句子一样理解整张图。
最好理解的例子
一张 224×224 图像按 16×16 切分后得到 196 个 Patch Token,模型像阅读序列一样处理它们。
核心机制
- 1
把图像切成固定大小的 Patch 并线性投影为 Token。
- 2
加入位置编码后送入 Transformer Encoder 建模全局关系。
- 3
汇总输出 Token,得到分类结果或可复用视觉表示。
为什么重要
它把 Transformer 扩展到视觉领域,并成为现代图像识别和多模态模型的重要骨干网络。
关键关系
前置知识
带来能力
快速对比
CNN 通过卷积天然强调局部邻域;ViT 主要依靠数据和 Attention 学习不同 Patch 之间的关系。
常见误解
ViT 的一个 Token 通常对应图像 Patch,而不是单个像素。
知识邻域
AI → Computer Vision → Vision Models