用于场景感知对话生成的熵增强多模态注意力模型
计算与语言
2019-08-23 v1
摘要
随着社交媒体信息量的增加,可获取的视频越来越多。因此,对视频进行推理的能力变得重要且值得探讨。对话系统技术挑战赛(DSTC7)(Yoshino et al. 2018)提出了一项视听场景感知对话(AVSD)任务,该任务包含视频、对话历史、摘要和字幕这五种模态,构成一个场景感知环境。本文中,我们提出熵增强动态记忆网络(DMN)来有效建模视频模态。所提模型中基于注意力的GRU能够提升模型理解和记忆序列信息的能力。熵机制可以使注意力分布更集中,从而使每个待回答的问题能更具体地聚焦于一小部分视频片段。在熵增强DMN获取视频上下文后,我们应用一个融合了摘要和字幕的注意力模型,针对关于视频的问题生成准确答案。在官方评估中,我们的系统在主观和客观评价指标上均能取得优于所发布基线模型的性能。
引用
@article{arxiv.1908.08191,
title = {Entropy-Enhanced Multimodal Attention Model for Scene-Aware Dialogue Generation},
author = {Kuan-Yen Lin and Chao-Chun Hsu and Yun-Nung Chen and Lun-Wei Ku},
journal= {arXiv preprint arXiv:1908.08191},
year = {2019}
}
备注
DSTC7 collocated with AAAI2019