监督式多模态学习中的单模态特征学习研究
计算机视觉与模式识别
2023-06-26 v3 多媒体
摘要
我们将多模态数据的特征(即学习到的表示)抽象为两类:1)单模态特征,可通过单模态训练学习;2)配对特征,只能通过跨模态交互学习。多模态模型应在保证单模态特征学习的基础上从跨模态交互中获益。然而,近期的监督式多模态后期融合训练方法仍面临各模态上单模态特征学习不足的问题。我们证明该现象确实会损害模型的泛化能力。为此,我们根据单模态特征与配对特征的分布,为给定的监督式多模态任务从单模态集成(UME)与所提出的单模态教师(UMT)中选择针对性的后期融合学习方法。我们表明,在一种简单的引导策略下,我们能在包括 VGG-Sound、Kinetics-400、UCF101 和 ModelNet40 在内的多个多模态数据集上取得与其他复杂后期融合或中间融合方法相当的结果。
引用
@article{arxiv.2305.01233,
title = {On Uni-Modal Feature Learning in Supervised Multi-Modal Learning},
author = {Chenzhuang Du and Jiaye Teng and Tingle Li and Yichen Liu and Tianyuan Yuan and Yue Wang and Yang Yuan and Hang Zhao},
journal= {arXiv preprint arXiv:2305.01233},
year = {2023}
}