中文

NeMo:针对视频语言理解的针织图中的针线寻宝

计算机视觉与模式识别 2025-10-14 v2 计算与语言

摘要

视频大语言模型(VideoLLM)的最新进展迫切需要新的评估协议和基准测试,以应对视频语言理解中复杂时序推理。灵感来自 LLM 广泛使用的针织图中的寻针测试,我们提出了一种新的寻宝任务——针织图中的针线(Needle in a Montage, NeMo),旨在评估 VideoLLM 的关键推理能力,包括长上下文记忆和时序定位。为生成本任务的视频问答数据,我们开发了可扩展的自动化数据生成管道,以促进高质量数据合成。基于所提出的管道,我们呈现了NeMoBench—a 以本任务为中心的视频语言基准测试。具体而言,NeMoBench 的完整数据集包含 31,378 个自动生成的问答(QA)对,涵盖 13,486 个视频,视频时长从几秒到数小时不等。实验表明,我们的管道能够可靠地自动生成高质量的评估数据,使 NeMoBench 能够持续更新最新视频。我们在本基准测试中评估了 20 个最先进的模型,提供了广泛的结果和关键见解,揭示了它们的能力与局限性。我们的项目页面地址:https://lavi-lab.github.io/NeMoBench。

关键词

引用

@article{arxiv.2509.24563,
  title  = {NeMo: Needle in a Montage for Video-Language Understanding},
  author = {Zi-Yuan Hu and Shuo Liang and Duo Zheng and Yanyang Li and Yeyao Tao and Shijia Huang and Wei Feng and Jia Qin and Jianguang Yu and Jing Huang and Meng Fang and Yin Li and Liwei Wang},
  journal= {arXiv preprint arXiv:2509.24563},
  year   = {2025}
}