中文

面向不平衡与噪声情境的贡献导向非对称学习:鲁棒多模态融合

多媒体 2025-11-17 v2

摘要

多模态学习面临两个主要挑战:模态不平衡和数据噪声,这显著影响模型的鲁棒性和泛化能力。现有方法通过抑制主导模态来实现模态平衡,但忽略了不同模态之间信息价值的内在差异,可能导致收敛到亚优解。本文提出一种创新的模态压缩范式——贡献导向非对称学习(CAL),旨在通过放大高贡献模态的贡献,同时压缩弱模态的贡献,以增强两者在多模态信息融合中的表现。CAL基于结合信息量 I(m) 和置信度 D(m) 的模态贡献度度量 W^m,设计了非对称梯度加速机制和贡献感知的非对称信息瓶颈(AIB)压缩机制。前者加速模态的梯度更新,后者动态压缩低贡献模态的噪声。在包括情感识别、场景识别和事件定位等五个基准数据集上,CAL 在不平衡融合任务和噪声鲁棒性测试中表现突出。在 CREMA-D、KS 和 AVE 上,CAL 分别实现了 79.30%、74.82% 和 74.21% 的准确率,显著优于现有最先进模型 ARL。在高噪声鲁棒性测试中,CAL 在 MVSA-Single 和 NYUD2 数据集上针对各种攻击策略也表现领先。这些结果验证了 CAL 在模态不平衡和噪声干扰方面的显著优势。作为一种灵活且高效的框架,CAL 易于迁移到其他任务,具有广泛的可适应性和潜在应用前景。

关键词

引用

@article{arxiv.2510.26289,
  title  = {Contribution-Guided Asymmetric Learning for Robust Multimodal Fusion under Imbalance and Noise},
  author = {Zijing Xu and Yunfeng Kou and Kunming Wu and Hong Liu},
  journal= {arXiv preprint arXiv:2510.26289},
  year   = {2025}
}