MMWorld:面向视频的多学科多维度世界模型评估
计算机视觉与模式识别
2024-07-31 v3 人工智能
计算与语言
摘要
多模态语言模型(MLLM)展示了“世界模型”——解释和推理复杂真实世界动态能力的新兴潜力。为了评估这些能力,我们认为视频是理想的媒介,因为它们包含了真实世界动态和因果关系的丰富表征。为此,我们引入了 MMWorld,一个用于多学科、多维度多模态视频理解的新基准。MMWorld 与以往视频理解基准不同,具有两个独特优势:(1)多学科覆盖需要专业知识进行全面理解的各个学科;(2)多维度推理,包括解释、反事实推理、未来预测等。MMWorld 包含由人工标注的数据集,用于评估 MLLMs 对整个视频的问题,以及用于分析 MLLMs 在单一感知模态内表现的合成数据集。总的来说,MMWorld 包含 1910 个视频,覆盖七个广泛学科和 69 个子学科,伴随 6627 个问答对及其相关描述。评估包括 2 个专有和 10 个开源 MLLMs,这些模型在 MMWorld 上表现不佳(例如 GPT-4V 以 52.3% 的准确率获得最佳成绩),显示出显大的提升空间。进一步的消融研究揭示了其他有趣发现,例如模型与人类不同的技能集合。我们希望 MMWorld 能成为世界模型在视频评估中的重要一步。
引用
@article{arxiv.2406.08407,
title = {MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos},
author = {Xuehai He and Weixi Feng and Kaizhi Zheng and Yujie Lu and Wanrong Zhu and Jiachen Li and Yue Fan and Jianfeng Wang and Linjie Li and Zhengyuan Yang and Kevin Lin and William Yang Wang and Lijuan Wang and Xin Eric Wang},
journal= {arXiv preprint arXiv:2406.08407},
year = {2024}
}