中文

通过样本级模态价值评估增强多模态协作

计算机视觉与模式识别 2024-06-17 v4 人工智能 机器学习 多媒体

摘要

多模态学习的一个主要课题是联合整合来自不同模态的异构信息。然而,大多数模型常常受困于不尽人意的多模态协作,无法很好地联合利用所有模态。一些方法被提出以识别并增强学习较差的模态,但它们往往难以在理论上提供支持的情况下,提供对样本级多模态协作的细粒度观测。因此,合理观测并改善模态间的细粒度协作至关重要,尤其是在面对模态差异在不同样本间可能变化的现实场景时。为此,我们引入了一种样本级模态价值评估度量,用以评价每个样本上各模态的贡献。通过模态价值评估,我们观察到模态差异在样本级确实可能不同,而非仅存在数据集级的全局贡献差异。我们进一步分析了该问题,并通过针对性地增强低贡献模态的判别能力,在样本级改善了模态间的协作。总体而言,我们的方法合理观测了细粒度的单模态贡献并取得了可观的提升。源代码与数据集可在 https://github.com/GeWu-Lab/Valuate-and-Enhance-Multimodal-Cooperation 获取。

关键词

引用

@article{arxiv.2309.06255,
  title  = {Enhancing multimodal cooperation via sample-level modality valuation},
  author = {Yake Wei and Ruoxuan Feng and Zihe Wang and Di Hu},
  journal= {arXiv preprint arXiv:2309.06255},
  year   = {2024}
}

备注

Accepted by CVPR 2024