Vinoground: 检验大型多模态模型在短视频密集时间推理能力
计算机视觉与模式识别
2024-10-04 v1 人工智能
计算与语言
机器学习
摘要
最近年来, 人们越来越认为现代大型多模态模型(LMM)已解决了短视频理解的大多数关键挑战。因此, 学术界和行业界正逐渐将注意力转向理解长视频所面临的更复杂挑战。然而, 这种情况真的如此吗?我们的研究表明, LMM即便在处理短视频时, 仍缺乏许多基本推理能力。我们引入Vinoground, 一个包含1000对短视频-文本描述的时序反事实LMM评估基准。我们展示, 现有的LMM在区分不同动作和物体变换之间的时序差异方面严重困难。例如, 最佳模型GPT-4o仅获得约50%的文本和视频得分, 相较于人类基准的约90%仍存在较大差距。所有开源多模态模型和基于CLIP的模型表现更差, 产生的 mostly random chance performance。通过本工作, 我们阐明了短视频时序推理仍是一个尚未完全解决的问题。该数据集和评估代码已提供于 https://vinoground.github.io。
引用
@article{arxiv.2410.02763,
title = {Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos},
author = {Jianrui Zhang and Mu Cai and Yong Jae Lee},
journal= {arXiv preprint arXiv:2410.02763},
year = {2024}
}
备注
Project Page: https://vinoground.github.io