中文

Chameleon:对缺失模态鲁棒的多模态学习仅需图像

计算机视觉与模式识别 2024-07-24 v1

摘要

多模态学习已证明其性能相比单模态架构有显著提升。然而,如果一种或多种模态缺失,多模态学习方法通常会表现出性能下降。这可能归因于常用的多分支设计,其中包含模态特定的流,使得模型依赖于完整模态集的可用性。在这项工作中,我们提出了一种鲁棒的文本-视觉多模态学习方法,名为Chameleon,它完全偏离了传统的多分支设计。为了实现这一点,我们提出了通过将文本模态编码为视觉表示,将输入模态统一为一种格式。因此,我们的方法不需要模态特定的分支来学习与模态无关的多模态表示,使其对缺失模态具有鲁棒性。我们在四个流行的挑战性数据集上进行了广泛的实验,包括Hateful Memes、UPMC Food-101、MM-IMDb和Ferramenta。Chameleon不仅在训练/测试时所有模态都存在的情况下实现了卓越的性能,而且在模态缺失的情况下也表现出显著的弹性。

关键词

引用

@article{arxiv.2407.16243,
  title  = {Chameleon: Images Are What You Need For Multimodal Learning Robust To Missing Modalities},
  author = {Muhammad Irzam Liaqat and Shah Nawaz and Muhammad Zaigham Zaheer and Muhammad Saad Saeed and Hassan Sajjad and Tom De Schepper and Karthik Nandakumar and Muhammad Haris Khan Markus Schedl},
  journal= {arXiv preprint arXiv:2407.16243},
  year   = {2024}
}