多模态通路:利用来自其他模态的无关数据改进Transformer
计算机视觉与模式识别
2024-03-19 v2 人工智能
机器学习
摘要
我们提出利用来自其他模态的无关数据来改进特定模态的Transformer,例如,用音频或点云数据集改进ImageNet模型。我们希望强调,目标模态的数据样本与其他模态的数据是无关的,这将我们的方法与利用不同模态的配对(例如CLIP)或交错数据的其他工作区分开来。我们提出了一种名为多模态通路(Multimodal Pathway)的方法——给定一个目标模态及其设计的Transformer,我们使用一个用另一模态数据训练的辅助Transformer,并构建连接两个模型组件的通路,使得目标模态的数据可以由两个模型共同处理。通过这种方式,我们利用了Transformer从两种模态获得的通用序列到序列建模能力。作为一个具体实现,我们像往常一样使用模态特定的分词器和任务特定的头部,但通过一种名为跨模态重参数化(Cross-Modal Re-parameterization)的方法利用辅助模型的Transformer块,该方法在没有任何推理成本的情况下利用了辅助权重。在图像、点云、视频和音频识别任务上,我们观察到利用来自其他模态的无关数据带来了显著且一致的性能提升。代码和模型可在https://github.com/AILab-CVC/M2PT获取。
引用
@article{arxiv.2401.14405,
title = {Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities},
author = {Yiyuan Zhang and Xiaohan Ding and Kaixiong Gong and Yixiao Ge and Ying Shan and Xiangyu Yue},
journal= {arXiv preprint arXiv:2401.14405},
year = {2024}
}
备注
CVPR 2024. Code and models are available at https://github.com/AILab-CVC/M2PT