中文

通过不平衡学习提升多模态学习性能

计算机视觉与模式识别 2025-07-22 v2

摘要

多模态学习常遇到优化不足的问题,可能表现不如单模态学习。现有方法认为该问题源于跨模态的不平衡学习,倾向于通过梯度平衡来解决。然而,本文指出,平衡的学习并非最佳设置。我们通过偏差-方差分析证明,各模态依赖度遵循其方差比例的反比例关系有助于获得最佳性能。为此,我们提出了Asymmetric Representation Learning(ARL)策略,通过不平衡优化来辅助多模态学习。ARL为每个模态编码器引入辅助正则化器,以计算其预测方差。ARL then 根据单模态方差来重新加权每个模态的优化,使模态依赖度比例与模态方差比例成反比。此外,为最小化泛化误差,ARL进一步引入每个模态的预测偏差,并与多模态损失联合优化。值得注意的是,所有辅助正则化器都与多模态模型共享参数,仅依赖于模态表示。因此,提出的ARL策略不引入额外参数,独立于多模态模型的结构和融合方法。最后,在各种数据集上进行的大量实验验证了ARL的有效性和通用性。代码可在 \href{https://github.com/shicaiwei123/ICCV2025-ARL}{https://github.com/shicaiwei123/ICCV2025-ARL} 获取。

关键词

引用

@article{arxiv.2507.10203,
  title  = {Improving Multimodal Learning via Imbalanced Learning},
  author = {Shicai Wei and Chunbo Luo and Yang Luo},
  journal= {arXiv preprint arXiv:2507.10203},
  year   = {2025}
}

备注

Accepted to ICCV2025