用于 DSTC8 AVSD 挑战赛的带指针网络的多模态 Transformer
计算与语言
2020-02-26 v1 计算机视觉与模式识别
机器学习
摘要
视听场景感知对话(AVSD)是视频问答(QA)的扩展,要求对话智能体生成自然语言回复以应对用户查询并进行对话。这是一项具有挑战性的任务,因为它包含多模态的视频特征,包括文本、视觉和音频特征。智能体还需学习用户话语与系统回复之间的语义依赖,从而与人类进行连贯对话。本文描述了我们向第八届对话系统技术挑战赛(DSTC8)AVSD 赛道提交的系统。我们采用点积注意力来融合输入视频的文本与非文本特征。我们通过采用指针网络在每一步生成中指向多个源序列中的词元,进一步增强了对话智能体的生成能力。我们的系统在自动指标上取得了高性能,并在所有人机评测提交中分获第 5 和第 6 名。
引用
@article{arxiv.2002.10695,
title = {Multimodal Transformer with Pointer Network for the DSTC8 AVSD Challenge},
author = {Hung Le and Nancy F. Chen},
journal= {arXiv preprint arXiv:2002.10695},
year = {2020}
}
备注
Accepted at DSTC Workshop at AAAI 2020