中文

面向多轮视频问答的问答引导视频表示学习

计算与语言 2019-08-01 v1

摘要

理解和交谈动态场景是导航环境并向人类传递有用信息的 AI 智能体的关键能力之一。视频问答是此类 AI-人类交互的一种具体场景,其中智能体针对有关动态场景视频的问题生成自然语言响应。融合来自多个模态的特征(通常提供补充信息)是视频问答中具有挑战性的方面之一。此外,一个问题往往只涉及视频的一小段,因此使用循环神经网络对整段视频序列进行编码在计算上效率不高。我们提出的问答引导视频表示模块由问题中的每个词引导,高效地生成词级别的视频摘要。随后将学习到的表示与问题融合以生成答案。通过在 Audio Visual Scene-aware Dialog (AVSD) 数据集上的实证评估,我们提出的模型在单轮和多轮问答中在多个自动自然语言生成评估指标上达到了最先进的(state-of-the-art)性能。

关键词

引用

@article{arxiv.1907.13280,
  title  = {Learning Question-Guided Video Representation for Multi-Turn Video Question Answering},
  author = {Guan-Lin Chao and Abhinav Rastogi and Semih Yavuz and Dilek Hakkani-Tür and Jindong Chen and Ian Lane},
  journal= {arXiv preprint arXiv:1907.13280},
  year   = {2019}
}

备注

Accepted at SIGDIAL 2019