通过交互式提示实现高效多模态融合
计算机视觉与模式识别
2023-05-16 v2
摘要
大规模预训练已将计算机视觉和自然语言处理等单模态领域带入新时代。顺应这一趋势,多模态学习模型的规模不断增加,迫切需要在下游任务微调这些模型时降低巨大的计算成本。本文提出一种高效且灵活的多模态融合方法,即PMF,专为融合单模态预训练的transformers而设计。具体而言,我们首先提出一个模块化的多模态融合框架,展现出高度灵活性并促进不同模态间的相互交互。此外,我们将普通提示解耦为三种类型,以学习多模态学习的不同优化目标。同样值得注意的是,我们提出仅在单模态transformers的深层添加提示向量,从而显著减少训练内存占用。实验结果表明,我们提出的方法以少于3%的可训练参数和高达66%的训练内存节省,实现了与几种其他多模态微调方法相当的性能。
引用
@article{arxiv.2304.06306,
title = {Efficient Multimodal Fusion via Interactive Prompting},
author = {Yaowei Li and Ruijie Quan and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2304.06306},
year = {2023}
}
备注
Camera-ready version for CVPR2023