中文

MINERVA-Cultural:面向文化与多语言长视频推理的基准测试

计算机视觉与模式识别 2026-04-08 v2

摘要

近期视频模型的进展显示出巨大的进步,特别是在长视频理解方面。然而,当前的基准测试主要以西方为中心的数据和英语为主导语言,在评估中引入了显著的偏差。为了解决这一问题,我们引入了 MINERVA-Cultural,一个用于多元文化和多语言视频推理的具有挑战性的基准测试。MINERVA-Cultural 包含来自 18 个全球地区的特定地域文化视频的高质量、完全由人工生成的标注。与以往依赖自动翻译的工作不同,MINERVA-Cultural 提供了以母语精心制作的复杂问题、答案和多步推理步骤。在 MINERVA-Cultural 上取得进展需要对视觉文化语境有深度的情境理解。此外,我们利用 MINERVA-Cultural 的推理轨迹构建基于证据的图,并提出了一种使用这些图来识别推理中细粒度错误的新颖迭代策略。我们的评估表明,SoTA Video-LLMs 遇到了显著困难,其表现远低于人类准确率,错误主要源于对文化元素的视觉感知。MINERVA-Cultural 将在 https://github.com/google-deepmind/neptune?tab=readme-ov-file#minerva-cultural 上公开发布。

关键词

引用

@article{arxiv.2601.10649,
  title  = {MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning},
  author = {Darshan Singh and Arsha Nagrani and Kawshik Manikantan and Harman Singh and Dinesh Tewari and Tobias Weyand and Cordelia Schmid and Anelia Angelova and Shachi Dave},
  journal= {arXiv preprint arXiv:2601.10649},
  year   = {2026}
}

备注

Accepted to CVPR 2026