中文

用于场景感知对话系统的多步联合模态注意力网络

计算与语言 2020-01-20 v1

摘要

理解动态场景与对话上下文以与用户交谈,一直是多模态对话系统的挑战。第 8 届对话系统技术挑战赛(DSTC8)提出了一种音视觉场景感知对话(AVSD)任务,其包含音频、视觉和语言等多种模态,用以评估对话系统如何理解不同模态并响应用户。本文中,我们提出了一种基于循环神经网络(RNN)的多步联合模态注意力网络(JMAN)以对视频进行推理。我们的模型执行多步注意力机制,并在每次推理过程中联合考虑视觉与文本表示,以更好地整合来自这两种不同模态的信息。与 AVSD 组织者发布的基线相比,我们的模型在 ROUGE-L 分数和 CIDEr 分数上分别取得了相对基线 12.1% 和 22.4% 的提升。

关键词

引用

@article{arxiv.2001.06206,
  title  = {Multi-step Joint-Modality Attention Network for Scene-Aware Dialogue System},
  author = {Yun-Wei Chu and Kuan-Yen Lin and Chao-Chun Hsu and Lun-Wei Ku},
  journal= {arXiv preprint arXiv:2001.06206},
  year   = {2020}
}

备注

DSTC8 collocated with AAAI2020