JASONATLAS

搜索 Jason Atlas

搜索缩写、中英文名称、别名与关键词

AnchorAI › Multimodal AI › Multimodal Learning

Multimodal Learning

多模态学习

一句话理解

多模态学习联合利用图像、文字、声音等不同形式的信息,让它们相互补充。

同一件事,从不同信息渠道一起理解。

最好理解的例子

判断视频里的人在说什么时,既可以听声音,也可以看口型;在声音被噪声干扰时,口型有机会补充语音信息。

核心机制

  1. 1

    取得图像、文字或声音等不同模态的数据。

  2. 2

    分别编码各模态,提取可用于任务的表示。

  3. 3

    对齐表示或融合不同来源的信息。

  4. 4

    根据共同任务目标训练并完成匹配、预测或回答。

关键关系

快速对比

CLIP 把图像和文字编码到可比较的空间;其他多模态模型会进一步融合表示,生成回答或预测。

常见误解

多模态不要求每个任务都同时输入所有模态;训练时学到跨模态联系后,也可以在部分模态上迁移使用。

知识邻域

AI → Multimodal AI