面向平衡多模态学习的即时调制
计算机视觉与模式识别
2024-10-16 v1 人工智能
机器学习
多媒体
摘要
多模态学习通过整合来自不同模态的信息来提升模型性能,然而其潜力未被充分发挥,因为主流的联合训练策略对所有模态采用统一目标,导致单模态表征不平衡且优化不足。具体而言,我们指出存在信息更具判别性的模态,例如足球比赛的视觉信息和吹风声的声音信息。它们可能主导联合训练过程,导致其他模态显著优化不足。为缓解此问题,我们首先从优化过程中前向传播和反向传播两个阶段分析该现象。随后提出即时预测调制(On-the-fly Prediction Modulation, OPM)和即时梯度调制(On-the-fly Gradient Modulation, OGM)策略,通过监控训练期间各模态之间的判别性差异来调制每个模态的优化。具体而言,OPM 在前向传播阶段通过以动态概率丢弃主导模态的特征来削弱其影响,而 OGM 在反向传播阶段抑制其梯度。实验表明,我们的方法在多种多模态任务上均显著提升。这些简单而有效的策略不仅提升了基础模型和任务导向多模态模型的性能,也在更复杂的多模态任务中展现出良好的效果与灵活性。源码可在 \url{https://github.com/GeWu-Lab/BML_TPAMI2024} 获取。
引用
@article{arxiv.2410.11582,
title = {On-the-fly Modulation for Balanced Multimodal Learning},
author = {Yake Wei and Di Hu and Henghui Du and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2410.11582},
year = {2024}
}
备注
Accepted by T-PAMI 2024