AnchorAI › Multimodal AI › Multimodal Learning
Multimodal Learning
多模态学习
一句话理解
多模态学习联合利用图像、文字、声音等不同形式的信息,让它们相互补充。
同一件事,从不同信息渠道一起理解。
最好理解的例子
判断视频里的人在说什么时,既可以听声音,也可以看口型;在声音被噪声干扰时,口型有机会补充语音信息。
核心机制
- 1
取得图像、文字或声音等不同模态的数据。
- 2
分别编码各模态,提取可用于任务的表示。
- 3
对齐表示或融合不同来源的信息。
- 4
根据共同任务目标训练并完成匹配、预测或回答。
关键关系
快速对比
CLIP 把图像和文字编码到可比较的空间;其他多模态模型会进一步融合表示,生成回答或预测。
常见误解
多模态不要求每个任务都同时输入所有模态;训练时学到跨模态联系后,也可以在部分模态上迁移使用。
知识邻域
AI → Multimodal AI