使用基于多模态注意力的视频特征的端到端音视觉场景感知对话
计算与语言
2018-07-03 v2 计算机视觉与模式识别
声音
音频与语音处理
摘要
对话系统需要理解动态视觉场景,以便与用户围绕其周围的物体和事件进行对话。用于真实世界应用的场景感知对话系统,可通过整合多个研究领域的先进技术来开发,包括:端到端对话技术,其利用从对话数据训练的模型生成系统回复;视觉问答(VQA)技术,其使用学习到的图像特征回答关于图像的问题;以及视频描述技术,其利用多模态信息从视频生成描述/字幕。我们引入了一个关于人类行为视频的对话新数据集。每段对话是一次打字会话,由两名Amazon Mechanical Turk(AMT)工人之间10个问答(QA)对的序列组成。我们总共在约9,000个视频上收集了对话。利用这个用于音视觉场景感知对话(AVSD)的新数据集,我们训练了一个端到端对话模型,该模型在关于视频的对话中生成回复。我们的实验表明,使用为多模态注意力视频描述开发的多模态特征,提升了关于动态场景(视频)的生成对话的质量。我们的数据集、模型代码和预训练模型将公开可用,用于一个新的视频场景感知对话挑战赛。
引用
@article{arxiv.1806.08409,
title = {End-to-End Audio Visual Scene-Aware Dialog using Multimodal Attention-Based Video Features},
author = {Chiori Hori and Huda Alamri and Jue Wang and Gordon Wichern and Takaaki Hori and Anoop Cherian and Tim K. Marks and Vincent Cartillier and Raphael Gontijo Lopes and Abhishek Das and Irfan Essa and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1806.08409},
year = {2018}
}
备注
A prototype system for the Audio Visual Scene-aware Dialog (AVSD) at DSTC7