中文

LongInsightBench:用于评估人类中心长视频理解的全模态基准

计算机视觉与模式识别 2025-10-22 v2 多媒体

摘要

我们提出了 \textbf{LongInsightBench},这是第一个专注于评估模型理解长视频能力的基准测试,重点关注人类语言、视角、动作及其他情境元素,同时整合 \textbf{视觉、音频和文本} 三种模态。基准测试在三个关键方面卓有突破:\textbf{a) 长时长、信息密集型视频:}我们仔细筛选了约 1000 个视频,基于时长限制和视觉与音频模态的信息密度,聚焦于讲座、采访和 vlog 等内容,这些内容包含丰富的语言元素。\textbf{b) 多样且具挑战性的任务场景:}我们设计了六个具有挑战性的任务场景,包括 intra-event 和 inter-event 任务。\textbf{c) 严谨且全面的质量保证管道:}我们开发了一个三步骤的半自动化数据质量保证管道,以确保综合问题和答案选项的难度和有效性。基于 LongInsightBench,我们设计了一系列实验。实验结果显示,Omni-modal 模型 (OLMs) 在需要精确时序定位 (T-Loc) 和长程因果推理 (CE-Caus) 的任务中仍面临挑战。扩展实验揭示了 OLMs 在多模态融合中的信息损失和处理偏差。我们的数据集和代码已在 https://anonymous.4open.science/r/LongInsightBench-910F/ 上提供。

关键词

引用

@article{arxiv.2510.17305,
  title  = {LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding},
  author = {ZhaoYang Han and Qihan Lin and Hao Liang and Bowen Chen and Zhou Liu and Wentao Zhang},
  journal= {arXiv preprint arXiv:2510.17305},
  year   = {2025}
}

备注

Submitted to ARR Rolling Review