在大型预训练Transformer中融合多模态信息
机器学习
2020-11-24 v3 计算与语言
机器学习
摘要
近期基于Transformer的上下文词表示,包括BERT和XLNet,已在NLP多个分支中展现出SOTA性能。在任务特定数据集上微调训练好的上下文模型是实现下游优越性能的关键。虽然对这些预训练模型进行微调对于词汇应用(仅含语言模态的应用)是直接了当的,但对于多模态语言(NLP中一个关注面对面交际建模的新兴领域)而言并非易事。预训练模型不具备接受视觉与声学这两种额外模态的必要组件。本文中,我们提出一种称为多模态适配门(Multimodal Adaptation Gate, MAG)的BERT与XLNet附加模块。MAG使BERT和XLNet能够在微调期间接受多模态非语言数据。其通过对BERT和XLNet的内部表示产生一个偏移来实现,该偏移以视觉和声学模态为条件。在我们的实验中,我们研究了多模态情感分析常用的CMU-MOSI和CMU-MOSEI数据集。微调MAG-BERT和MAG-XLNet相比以往基线以及仅语言微调的BERT和XLNet显著提升了情感分析性能。在CMU-MOSI数据集上,MAG-XLNet首次在NLP界实现了人类水平的多模态情感分析性能。
引用
@article{arxiv.1908.05787,
title = {Integrating Multimodal Information in Large Pretrained Transformers},
author = {Wasifur Rahman and Md. Kamrul Hasan and Sangwu Lee and Amir Zadeh and Chengfeng Mao and Louis-Philippe Morency and Ehsan Hoque},
journal= {arXiv preprint arXiv:1908.05787},
year = {2020}
}