JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

AnchorAI › Computer Vision › Vision-Language › CLIP

CLIP

Contrastive Language–Image Pre-training

对比式语言-图像预训练

一句话理解

CLIP 通过对比学习,把匹配的图像和文本映射到相近的向量空间。

把文本描述临时当成分类器;图像更接近哪段文字,就更像哪个类别。

最好理解的例子

给一张新图片配上“猫”“汽车”“海滩”等文本,选择与图片向量最接近的描述即可做零样本分类。

核心机制

  1. 1

    图像编码器与文本编码器分别产生归一化向量。

  2. 2

    对一个批次中的图文组合计算相似度。

  3. 3

    拉近匹配图文并推远不匹配图文,形成共享语义空间。

为什么重要

它让视觉模型能够借助自然语言迁移到开放词汇识别、跨模态检索和生成模型引导等任务。

应用

  • 图文检索
  • 零样本图像分类
  • 生成模型的文本条件与质量评估

相关术语

关键关系

快速对比

传统分类器从固定类别头中选标签;CLIP 可以把文本提示临时作为类别描述。

常见误解

CLIP 本身主要负责表示和匹配,并不是图像生成模型。

知识邻域

AI → Computer Vision → Vision-Language