Cinéaste:面向细粒度情境电影问答的基准数据集
计算机视觉与模式识别
2025-09-18 v1
摘要
虽然近期视觉语言模型的进展提升了视频理解能力,但诊断其进行深层叙事理解的能力仍面临挑战。现有基准测试往往测试短片段识别或使用模板化问题,留下了在长篇叙事内容上进行细粒度推理评估的关键空白。为此,我们引入 ,用于长篇电影理解的全面基准数据集。该数据集包含 3,119 个多选问答对,源自 200 部覆盖面广的电影中 1,805 个场景,涵盖五个新颖的细粒度情境推理类别。我们使用 GPT-4o 通过整合视觉描述、字幕、场景标题和概述,生成具有多样性和情境丰�性的问答对,这些问答需要深层叙事理解。为确保高质量评估,我们的管道包含两个阶段的过滤过程:情境独立性过滤确保问题需要视频情境,情境真实性过滤则验证问题在电影内容中的事实一致性,缓解幻觉现象。实验表明,现有 MLLMs 在 上表现不佳;我们的分析显示,长程时序推理是主要瓶颈,最好的开源模型仅达到 63.15% 的准确率。这凸显了在细粒度情境理解方面的重大挑战,以及在长篇电影理解方面的需求。
引用
@article{arxiv.2509.14227,
title = {Cin\'{e}aste: A Fine-grained Contextual Movie Question Answering Benchmark},
author = {Nisarg A. Shah and Amir Ziai and Chaitanya Ekanadham and Vishal M. Patel},
journal= {arXiv preprint arXiv:2509.14227},
year = {2025}
}
备注
11 pages, 5 figures, 5 tables