TMT: 一种基于 Transformer 的模态翻译器用于改进音视觉场景感知对话中的多模态序列表示
计算与语言
2020-10-22 v1
摘要
音视觉场景感知对话(AVSD)是一项在针对给定视频进行讨论时生成回复的任务。此前的最优模型利用基于 Transformer 的架构在该任务上展现出优越性能。然而,在学习更优的模态表示方面仍存在若干局限。受神经机器翻译(NMT)启发,我们提出基于 Transformer 的模态翻译器(TMT),以有监督方式通过将源模态序列翻译至相关目标模态序列来学习源模态序列的表示。基于多模态 Transformer 网络(MTN),我们将 TMT 应用于视频与对话,提出用于视频接地对话系统的 MTN-TMT。在对话系统技术挑战赛 7 的 AVSD 赛道上,MTN-TMT 在视频与文本任务及仅文本任务中均优于 MTN 与其他提交模型。与 MTN 相比,MTN-TMT 改进了所有指标,尤其在 CIDEr 上实现了高达 14.1% 的相对提升。索引词:多模态学习,音视觉场景感知对话,神经机器翻译,多任务学习
引用
@article{arxiv.2010.10839,
title = {TMT: A Transformer-based Modal Translator for Improving Multimodal Sequence Representations in Audio Visual Scene-aware Dialog},
author = {Wubo Li and Dongwei Jiang and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:2010.10839},
year = {2020}
}