通过即时梯度调制实现平衡多模态学习
计算机视觉与模式识别
2022-03-30 v1 人工智能
摘要
多模态学习通过整合不同感官来全面理解世界。因此,多输入模态有望提升模型性能,但我们实际发现即便多模态模型优于其单模态对应模型,这些模态也未被充分利用。具体而言,本文指出现有多模态判别模型对所有模态设计统一目标,在某些场景中可能因另一主导模态(如起风事件中的声音、画画事件中的视觉等)而导致未被充分优化的单模态表示。为缓解此优化不平衡,我们提出即时梯度调制,通过监测各模态对学习目标贡献的差异,自适应地控制每个模态的优化。此外,引入动态变化的额外高斯噪声,以避免梯度调制可能引起的泛化下降。结果表明,我们在不同多模态任务上相较常见融合方法取得显著提升,且该简单策略亦可增强现有多模态方法,说明了其有效性与通用性。源代码见 \url{https://github.com/GeWu-Lab/OGM-GE_CVPR2022}。
引用
@article{arxiv.2203.15332,
title = {Balanced Multimodal Learning via On-the-fly Gradient Modulation},
author = {Xiaokang Peng and Yake Wei and Andong Deng and Dong Wang and Di Hu},
journal= {arXiv preprint arXiv:2203.15332},
year = {2022}
}
备注
Accepted by CVPR 2022 (ORAL)