MERLOT:多模态神经脚本知识模型
计算机视觉与模式识别
2021-10-25 v3 计算与语言
机器学习
摘要
作为人类,我们在语境中理解视觉世界中的事件,跨时间执行多模态推理以推断过去、现在和未来。我们提出MERLOT,一种通过观看数百万个带转录语音的YouTube视频——以完全无标签、自监督的方式——学习多模态脚本知识的模型。通过以帧级(空间)与视频级(时间)目标混合进行预训练,我们的模型不仅学习将图像与 temporally 对应的词语匹配,还学习对全局随时间发生的内容进行语境化。因此,MERLOT展现出强大的开箱即用的时间常识表示,并在微调后在12个不同视频QA数据集上取得state-of-the-art性能。它也能很好地迁移到静态图像领域,使模型能够推理视觉场景背后的动态语境。在Visual Commonsense Reasoning上,MERLOT以80.6%准确率正确回答问题,优于类似规模的state-of-the-art模型逾3%,即便那些重度使用辅助监督数据(如物体边界框)的模型。消融分析证明了以下方面的互补重要性:1)在视频而非静态图像上训练;2)扩大预训练视频语料的规模与多样性;3)使用鼓励从识别到认知层级全栈多模态推理的多样目标。
引用
@article{arxiv.2106.02636,
title = {MERLOT: Multimodal Neural Script Knowledge Models},
author = {Rowan Zellers and Ximing Lu and Jack Hessel and Youngjae Yu and Jae Sung Park and Jize Cao and Ali Farhadi and Yejin Choi},
journal= {arXiv preprint arXiv:2106.02636},
year = {2021}
}
备注
project page at https://rowanzellers.com/merlot; NeurIPS 2021 camera ready