TEASEL:一种基于Transformer的语音前缀语言模型
计算与语言
2021-09-14 v1 人工智能
机器学习
摘要
多模态语言分析是NLP中一个新兴领域,旨在同时建模说话者的词语、声学标注与面部表情。在该领域,词汇特征通常优于其他模态,因为它们通过基于Transformer的模型在大型语料上进行了预训练。尽管性能强劲,但由于数据不足(多模态语言学习即如此),在任何模态上训练新的自监督学习(SSL)Transformer通常难以实现。本工作提出一种称为TEASEL的基于Transformer的语音前缀语言模型,以在不训练完整Transformer模型的情况下应对上述限制。与传统语言模型相比,TEASEL模型除文本模态外还将语音模态作为动态前缀纳入。该方法将常规预训练语言模型用作跨模态Transformer模型。我们在CMU-MOSI数据集定义的多模态情感分析任务上评估了TEASEL。大量实验表明,我们的模型在F1分数上比单模态基线语言模型高出4%,并比当前多模态最优(SoTA)模型高出1%。此外,我们提出的方法比SoTA模型小72%。
引用
@article{arxiv.2109.05522,
title = {TEASEL: A Transformer-Based Speech-Prefixed Language Model},
author = {Mehdi Arjmand and Mohammad Javad Dousti and Hadi Moradi},
journal= {arXiv preprint arXiv:2109.05522},
year = {2021}
}