ConceptAI › Computer Vision › Recognition › Open-vocabulary Recognition
Open-vocabulary Recognition
开放词汇识别
一句话理解
识别时的类别集合不必固定在训练标签中,可以通过文字动态扩展。
最好理解的例子
检测器原本没有固定“消防栓”类别,也可在推理时输入这个文本名称并在图像中寻找对应区域。
核心机制
- 1
把图像或图像区域编码为视觉向量。
- 2
把运行时给出的任意类别名称或描述编码为文本向量。
- 3
比较跨模态相似度,让输入词汇动态决定预测类别集合。
关键关系
知识邻域
AI → Computer Vision → Recognition