AnchorAI › Computer Vision › Vision-Language › CLIP
CLIP
Contrastive Language–Image Pre-training
对比式语言-图像预训练
一句话理解
CLIP 通过对比学习,把匹配的图像和文本映射到相近的向量空间。
把文本描述临时当成分类器;图像更接近哪段文字,就更像哪个类别。
最好理解的例子
给一张新图片配上“猫”“汽车”“海滩”等文本,选择与图片向量最接近的描述即可做零样本分类。
核心机制
- 1
图像编码器与文本编码器分别产生归一化向量。
- 2
对一个批次中的图文组合计算相似度。
- 3
拉近匹配图文并推远不匹配图文,形成共享语义空间。
为什么重要
它让视觉模型能够借助自然语言迁移到开放词汇识别、跨模态检索和生成模型引导等任务。
应用
- 图文检索
- 零样本图像分类
- 生成模型的文本条件与质量评估
相关术语
关键关系
快速对比
传统分类器从固定类别头中选标签;CLIP 可以把文本提示临时作为类别描述。
常见误解
CLIP 本身主要负责表示和匹配,并不是图像生成模型。
知识邻域
AI → Computer Vision → Vision-Language