诊断与再学习:平衡多模态学习中的关键方法
计算机视觉与模式识别
2024-07-16 v1 人工智能
多媒体
摘要
为克服多模态学习中不平衡的问题——即模型倾向于训练特定模态——现有方法从不同角度控制单模态编码器的训练,以模态间性能差异为基础。然而,忽略了模态容量的内在限制。信息稀缺的模态可被识别为“学习较差”的模态,这会迫使模型更多地记忆噪声,从而负面影响多模态模型的能力。此外,当前的模态调制方法仅狭窄地关注选定的“学习较差”模态,甚至抑制了其他模态的训练。因此,考虑模态容量的内在限制并在平衡过程中纳入所有模态至关重要。为此,我们提出了诊断与再学习方法。首先基于单模态表示空间的可分性估计每个模态的学习状态,然后用于软化重新初始化相应的单模态编码器。如此可避免对信息稀缺模态的过度强调。此外,同时增强“学习较差”模态的编码器,以避免其他模态的过度训练。因此,有效平衡并提升了多模态学习。涵盖多种模态类型和多模态框架的实验表明,我们简单却有效的方法在平衡多模态学习方面表现优异。源代码和数据集可在 \url{https://github.com/GeWu-Lab/Diagnosing_Relearning_ECCV2024} 获取。
引用
@article{arxiv.2407.09705,
title = {Diagnosing and Re-learning for Balanced Multimodal Learning},
author = {Yake Wei and Siwei Li and Ruoxuan Feng and Di Hu},
journal= {arXiv preprint arXiv:2407.09705},
year = {2024}
}
备注
Accepted by ECCV 2024