面向多模态表示偏置的非对称强化方法
计算机视觉与模式识别
2025-01-03 v1
摘要
多模态学习之所以强大,正在于其能够整合来自各种信息源的资料,提供丰富而全面的见解。然而,在现实场景中,多模态系统常面临动态模态贡献的挑战,不同模态的主导地位可能随环境变化而改变,导致多模态学习表现不佳。当前方法主要通过增强弱模态来平衡多模态表示偏置,这不可避免地从局部模态的角度进行优化,容易导致主导模态的性能下降。为此,我们提出了一种针对多模态表示偏置的非对称强化方法(Asymmetric Reinforcing method against Multimodal bias, ARM)。我们的 ARM 通过条件互信息动态强化弱模态,同时保持对主导模态的表征能力。我们深入分析表明,针对性地优化某些模态可能导致信息损失,阻碍充分利用多模态数据的优势。通过探索模态的主导性并缩小模态贡献之间的差距,我们显著提升了多模态学习的性能,在缓解不平衡的多模态学习方面取得了显著进展。
引用
@article{arxiv.2501.01240,
title = {Asymmetric Reinforcing against Multi-modal Representation Bias},
author = {Xiyuan Gao and Bing Cao and Pengfei Zhu and Nannan Wang and Qinghua Hu},
journal= {arXiv preprint arXiv:2501.01240},
year = {2025}
}
备注
Accepted by AAAI 2025