基于游戏的视频上下文对话
计算与语言
2018-10-18 v2 人工智能
计算机视觉与模式识别
摘要
当前的对话系统更多关注文本和语音上下文知识,且通常基于两个说话者。一些近期工作研究了基于静态图像的对话。然而,若干真实世界的人类交互也涉及动态视觉上下文(类似于视频)以及多个说话者之间的对话交流。为更接近此类多模态对话技能和视觉情境应用,我们基于直播足球比赛视频和来自 Twitch.tv 的聊天,引入了一个新的视频上下文、多说话者对话数据集。这一具有挑战性的测试平台使我们能够开发视觉接地的对话模型,该模型应从直播视频生成相关的时空事件语言,同时也与聊天历史相关。为提供强基线,我们还提出了几种判别式和生成式模型,例如基于三向注意力流 (TriDAF) 的模型。我们通过检索排序-召回率、自动短语匹配指标以及人工评估研究对这些模型进行评估。我们还呈现数据集分析、模型消融和可视化,以理解不同模态和模型组件的贡献。
引用
@article{arxiv.1809.04560,
title = {Game-Based Video-Context Dialogue},
author = {Ramakanth Pasunuru and Mohit Bansal},
journal= {arXiv preprint arXiv:1809.04560},
year = {2018}
}
备注
EMNLP 2018 (14 pages) (fixed Table5 typo in v2)