基于问答方法与数据增强的多模态对话状态跟踪
计算与语言
2020-07-21 v1
摘要
近来,一项更具挑战性的状态跟踪任务——音视频场景感知对话(AVSD)正受到研究者越来越多的关注。与纯基于文本的对话状态跟踪不同,AVSD中的对话包含关于一段视频的一系列问答对,且对给定问题的最终回答需要额外理解视频内容。本文从开放域问答(QA)的视角解读AVSD任务,并提出一个多模态开放域QA系统来处理该问题。所提QA系统采用带有多模态融合与注意力的通用编码器-解码器框架。教师强制被用于训练自然语言生成器。我们还提出了一种在QA假设下专用的新数据增强方法。我们的实验表明,在DSTC7-AVSD数据集上,我们的模型与技术相较基线模型带来显著提升,并展示了我们数据增强技术的潜力。
引用
@article{arxiv.2007.09903,
title = {Multimodal Dialogue State Tracking By QA Approach with Data Augmentation},
author = {Xiangyang Mou and Brandyn Sigouin and Ian Steenstra and Hui Su},
journal= {arXiv preprint arXiv:2007.09903},
year = {2020}
}
备注
AAAI DSTC8 Workshop