TextMI:将多模态信息文本化以在非言语线索中融入预训练语言模型
计算与语言
2023-03-30 v2 机器学习
摘要
预训练大语言模型近来在多种语言理解任务中取得了突破性性能。然而,除非能将非言语特征(如声学与视觉特征)与语言相融合,否则同一模型无法应用于多模态行为理解任务(例如视频情感/幽默检测)。联合建模多种模态会显著增加模型复杂度,并使训练过程极度依赖数据。尽管可通过网络获取海量文本数据,但收集大规模多模态行为视频数据集在时间与资金上均极为昂贵。本文研究当非言语信息以文本形式呈现时,仅用大语言模型能否成功整合此类信息。我们提出一种将声学与视觉信息转换为相应文本描述并与口语文本拼接的方法。我们将此增强输入送入预训练 BERT 模型,并在三个下游多模态任务上微调:情感、幽默与讽刺检测。我们的方法 TextMI 显著降低了模型复杂度,增加了模型决策的可解释性,并可应用于多种任务,同时取得优越(多模态讽刺检测)或接近 SOTA(多模态情感分析与多模态幽默检测)的性能。我们提出 TextMI 作为多模态行为分析任务、尤其在低资源设定下的一般且具有竞争力的基线。
引用
@article{arxiv.2303.15430,
title = {TextMI: Textualize Multimodal Information for Integrating Non-verbal Cues in Pre-trained Language Models},
author = {Md Kamrul Hasan and Md Saiful Islam and Sangwu Lee and Wasifur Rahman and Iftekhar Naim and Mohammed Ibrahim Khan and Ehsan Hoque},
journal= {arXiv preprint arXiv:2303.15430},
year = {2023}
}