中文

用于端到端视频依据对话系统的多模态 Transformer 网络

计算与语言 2020-02-26 v1

摘要

开发视频依据对话系统(VGDS),即基于给定视频的视觉与听觉方面进行对话,比传统的图像或文本依据对话系统更具挑战性,因为(1)视频的特征空间跨越多个图像帧,难以获取语义信息;(2)对话智能体必须感知并处理来自不同模态(音频、视频、字幕等)的信息以获得全面理解。大多数现有工作基于 RNN 和序列到序列架构,对于捕捉复杂长期依赖(如视频中)并不十分有效。为克服此问题,我们提出多模态 Transformer 网络(MTN)来编码视频并融合来自不同模态的信息。我们还通过自编码器提出查询感知注意力,以从非文本模态中提取查询感知特征。我们开发了一种训练流程来模拟 token 级解码,以改进推理阶段生成响应的质量。我们在对话系统技术挑战赛 7(DSTC7)上取得了最先进的性能。我们的模型也泛化到另一多模态视觉依据对话任务,并获得了有前景的性能。我们使用 PyTorch 实现了模型,代码发布于 https://github.com/henryhungle/MTN。

关键词

引用

@article{arxiv.1907.01166,
  title  = {Multimodal Transformer Networks for End-to-End Video-Grounded Dialogue Systems},
  author = {Hung Le and Doyen Sahoo and Nancy F. Chen and Steven C. H. Hoi},
  journal= {arXiv preprint arXiv:1907.01166},
  year   = {2020}
}

备注

Accepted at ACL 2019 (Long Paper)