中文

用于多模态情感识别的高效端到端Transformer与渐进三模态注意力

计算与语言 2022-09-21 v1

摘要

近期多模态情感识别的工作趋向于端到端模型,相较于两阶段流水线,此类模型可在目标任务监督下提取任务特定特征。然而,以往方法仅对文本与声学或视觉模态之间的特征交互建模,忽略了捕捉声学与视觉模态之间的特征交互。本文提出多模态端到端Transformer(ME2ET),可有效在低层与高层对文本、声学和视觉模态间的三模态特征交互建模。在低层,我们提出渐进三模态注意力,采用两遍策略对三模态特征交互建模,并进一步利用此类交互通过缩减输入token长度显著降低计算与内存复杂度。在高层的,我们引入三模态特征融合层以显式聚合三模态的语义表示。在CMU-MOSEI与IEMOCAP数据集上的实验结果表明,ME2ET取得了最先进的性能。进一步的深入分析证明了所提渐进三模态注意力的有效性、高效性与可解释性,其能在显著降低计算与内存开销的同时帮助模型获得更优性能。我们的代码将公开可用。

关键词

引用

@article{arxiv.2209.09768,
  title  = {An Efficient End-to-End Transformer with Progressive Tri-modal Attention for Multi-modal Emotion Recognition},
  author = {Yang Wu and Pai Peng and Zhenyu Zhang and Yanyan Zhao and Bing Qin},
  journal= {arXiv preprint arXiv:2209.09768},
  year   = {2022}
}