利用大规模预训练模型改进判别性多模态学习
计算机视觉与模式识别
2023-10-10 v1
摘要
本文研究如何更好地利用大规模预训练单模态模型来进一步增强判别性多模态学习。即使仅使用单模态数据微调,这些模型在某些任务上也能优于以往的多模态模型。显然,将它们引入多模态学习将显著提升性能。然而,使用这些模型的多模态学习仍存在单模态特征学习不足的问题,这削弱了所得多模态模型的泛化能力。虽然分别微调单模态模型再聚合其预测是直接的方法,但它无法充分实现模态间的适配,同样导致次优结果。为此,我们提出多模态低秩适配学习(MMLoRA)。通过冻结单模态微调模型的权重,向其添加额外的可训练秩分解矩阵,随后进行多模态联合训练,我们的方法增强了模态间的适配并提升了整体性能。我们在三类数据集上展示了 MMLoRA 的有效性:音视觉(如 AVE、Kinetics-Sound、CREMA-D)、视觉-语言(如 MM-IMDB、UPMC Food101)和 RGB-光流(UCF101)。
引用
@article{arxiv.2310.05193,
title = {Improving Discriminative Multi-Modal Learning with Large-Scale Pre-Trained Models},
author = {Chenzhuang Du and Yue Zhao and Chonghua Liao and Jiacheng You and Jie Fu and Hang Zhao},
journal= {arXiv preprint arXiv:2310.05193},
year = {2023}
}