MMPareto:通过无辜单模态帮助提升多模态学习
计算机视觉与模式识别
2024-05-29 v1 人工智能
机器学习
多媒体
摘要
具有针对性单模态学习目标的多模态学习方法在缓解不平衡的多模态学习问题方面表现出卓越效能。然而,本文指出,在此过程中存在被忽视的多模态与单模态学习目标之间的梯度冲突,可能误导单模态编码器的优化。为充分减轻这些冲突,我们观察到多模态损失与单模态损失之间的差异,其中更易学习的多模态损失在梯度幅度和协方差上均小于单模态损失。基于此属性,我们在所提出的多模态情境下分析 Pareto 集成,并提出 MMPareto 算法,该算法能够确保最终梯度的方向与所有学习目标一致,并增强梯度幅度以提高泛化性能,提供无辜的单模态帮助。最终,通过实验表明,在多种模态类型和框架中密集的跨模态交互下,我们的方法表现出优越且可扩展的性能。该方法也有望促进具有任务难度明显差异的多任务案例。源代码和数据集已提供,链接为 https://github.com/GeWu-Lab/MMPareto_ICML2024。
引用
@article{arxiv.2405.17730,
title = {MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance},
author = {Yake Wei and Di Hu},
journal= {arXiv preprint arXiv:2405.17730},
year = {2024}
}
备注
Accepted by ICML2024