利用多模态Transformer改进单模态推理
机器学习
2023-11-20 v1
摘要
本文提出一种通过多模态训练提升单模态模型性能的方法。我们的方法采用多分支架构,将单模态模型与一个基于多模态Transformer的分支相结合。通过联合训练这些分支,更强的多模态分支可借助多任务目标将其知识迁移至较弱的单模态分支,从而提升所得单模态模型的性能。我们在基于RGB与Depth的动态手势识别、基于语音与面部视频的音视频情感识别,以及基于音频-视频-文本的 sentiment analysis 任务上评估了该方法。我们的方法优于常规训练的单模态对应模型。有趣的是,我们还观察到单模态分支的优化亦改善了多模态分支,相较于从头训练的类似多模态模型。
引用
@article{arxiv.2311.10170,
title = {Improving Unimodal Inference with Multimodal Transformers},
author = {Kateryna Chumachenko and Alexandros Iosifidis and Moncef Gabbouj},
journal= {arXiv preprint arXiv:2311.10170},
year = {2023}
}