接下来更可能发生什么?视频与语言未来事件预测
计算与语言
2020-10-19 v1 人工智能
计算机视觉与模式识别
摘要
给定一段带有对齐对话的视频,人们通常可以推断接下来更可能发生什么。做出此类预测不仅需要对视频与对话背后丰富动态的深度理解,还需要大量的常识知识。在本工作中,我们探究 AI 模型是否能够学会做出此类多模态常识下一事件预测。为支持该方向的研究,我们收集了一个名为视频与语言事件预测(VLEP)的新数据集,包含来自 10,234 个多样化电视节目和 YouTube 生活方式视频博客片段的 28,726 个未来事件预测示例(及其理由)。为促成非平凡且具有挑战性示例的收集,我们采用了一种对抗式人-模型协同数据收集流程。我们还提出了一个融合视频、对话与常识知识信息的强基线。实验表明每类信息对此挑战性任务均有助益,并且相较于人类在 VLEP 上的高表现,我们的模型提供了一个良好的起点,但仍有很大改进空间。我们的数据集与代码可见于:https://github.com/jayleicn/VideoLanguageFuturePred。
引用
@article{arxiv.2010.07999,
title = {What is More Likely to Happen Next? Video-and-Language Future Event Prediction},
author = {Jie Lei and Licheng Yu and Tamara L. Berg and Mohit Bansal},
journal= {arXiv preprint arXiv:2010.07999},
year = {2020}
}
备注
EMNLP 2020 (17 pages)