中文

视听场景感知对话

计算机视觉与模式识别 2019-05-10 v2

摘要

我们引入了场景感知对话任务。我们的目标是在给定场景的视频与音频以及对话历史的情况下,针对关于该场景的问题生成完整且自然的回复。为了成功作答,智能体必须将问题中的概念锚定到视频中,同时利用来自对话历史的上下文线索。为了对该任务进行基准测试,我们引入了视听场景感知对话(AVSD)数据集。对于来自 Charades 数据集的超过 11000 段人类动作视频,我们的数据集包含关于该视频的一段对话,以及由其中一名对话参与者给出的视频最终摘要。我们为该任务训练了若干基线系统,并使用定性与定量指标评估所训练模型的性能。我们的结果表明,模型必须利用所有可用输入(视频、音频、问题与对话历史)才能在该数据集上取得最佳表现。

关键词

引用

@article{arxiv.1901.09107,
  title  = {Audio-Visual Scene-Aware Dialog},
  author = {Huda Alamri and Vincent Cartillier and Abhishek Das and Jue Wang and Anoop Cherian and Irfan Essa and Dhruv Batra and Tim K. Marks and Chiori Hori and Peter Anderson and Stefan Lee and Devi Parikh},
  journal= {arXiv preprint arXiv:1901.09107},
  year   = {2019}
}