中文

模态偏置的识别与缓解

计算机视觉与模式识别 2022-09-28 v2

摘要

使多模态数据中的每种模态都能发挥作用,对于学习一个通用的多模态模型至关重要。然而,现有方法在模型训练过程中常常被一种或少数几种模态所主导,导致次优性能。在本文中,我们将此问题称为模态偏置,并尝试在多模态分类的背景下系统而全面地研究它。经过若干实证分析,我们认识到某一模态对模型预测影响更大,仅仅是因为该模态与样本标签之间存在虚假相关性。为了 primarily 促进对模态偏置问题的评估,我们依据分布外(OoD)协议,分别为彩色数字识别和视频动作识别任务构建了两个数据集。结合视觉问答任务中的基准,我们从经验上证实了现有方法在这些 OoD 数据集上的性能下降,这作为证据证明了模态偏置学习的存在。此外,为克服该问题,我们提出了一种即插即用的损失函数方法,据此根据训练集统计信息自适应地学习每个标签的特征空间。此后,我们将该方法应用于共计八个基线以测试其有效性。在针对上述三个任务的四个数据集上的结果表明,与基线相比,我们的方法取得了显著的性能提升,证明了其在缓解模态偏置问题上的优越性。

关键词

引用

@article{arxiv.2202.12690,
  title  = {On Modality Bias Recognition and Reduction},
  author = {Yangyang Guo and Liqiang Nie and Harry Cheng and Zhiyong Cheng and Mohan Kankanhalli and Alberto Del Bimbo},
  journal= {arXiv preprint arXiv:2202.12690},
  year   = {2022}
}

备注

Accepted by ToMM