从 FiLM 到视频:基于多模态上下文的多轮问答
计算与语言
2018-12-19 v1 计算机视觉与模式识别
摘要
理解视听内容以及就其与系统进行信息丰富的对话,一直是智能系统面临的挑战性领域。音频视觉场景感知对话(AVSD)挑战赛作为对话系统技术挑战赛 7(DSTC7)的一个赛道,提出了一项组合任务:系统需在给定的对话(含历史问答对)和视频本身的情况下,回答与该视频相关的问题。针对该任务,我们提出了一种分层编码器-解码器模型,用于计算对话上下文的多模态嵌入。该模型首先使用两个 LSTM 嵌入对话历史。我们以固定间隔提取视频和音频帧,并分别使用预训练的 I3D 和 VGGish 模型计算语义特征。在使用 LSTM 将两种模态汇总为定长向量之前,我们利用 FiLM 模块使其以当前问题的嵌入为条件,从而大幅降低维度。最后,我们使用一个 LSTM 解码器,通过 scheduled sampling 进行训练,并使用 beam search 进行评估。与 AVSD 挑战赛组织者发布的模态融合基线模型相比,我们的模型取得了超过 16% 的相对提升,BLEU-4 得分为 0.36,以及超过 33% 的相对提升,CIDEr 得分为 0.997。
引用
@article{arxiv.1812.07023,
title = {From FiLM to Video: Multi-turn Question Answering with Multi-modal Context},
author = {Dat Tien Nguyen and Shikhar Sharma and Hannes Schulz and Layla El Asri},
journal= {arXiv preprint arXiv:1812.07023},
year = {2018}
}
备注
Accepted for an Oral presentation at the DSTC7 workshop at AAAI 2019