中文

用于非对齐多模态语言序列的多模态 Transformer

计算与语言 2019-06-04 v1

摘要

人类语言通常是多模态的,它理解自然语言、面部手势和声学行为的混合。然而,对此类多模态人类语言时间序列数据建模存在两个主要挑战:1)由于各模态序列的采样率可变导致的固有数据非对齐;以及 2)跨模态元素之间的长程依赖。在本文中,我们引入多模态 Transformer(MulT)以端到端方式通用地解决上述问题,而无需显式对齐数据。我们模型的核心是有向成对跨模态注意力,它关注于不同时间步上多模态序列之间的交互,并潜在地将一个模态的流适配到另一个模态。在对齐和非对齐多模态时间序列上的综合实验表明,我们的模型大幅优于最先进的方法。此外,实证分析表明,相关的跨模态信号能够被 MulT 中提出的跨模态注意力机制捕获。

关键词

引用

@article{arxiv.1906.00295,
  title  = {Multimodal Transformer for Unaligned Multimodal Language Sequences},
  author = {Yao-Hung Hubert Tsai and Shaojie Bai and Paul Pu Liang and J. Zico Kolter and Louis-Philippe Morency and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:1906.00295},
  year   = {2019}
}