VideoOdyssey:面向超长上下文与全模态视频理解的基准
计算机视觉与模式识别
2026-05-25 v1
摘要
现实世界的长视频理解要求模型在极端视频时长内执行连续跟踪、信息整合和记忆保持,这构成了长视频理解的根本瓶颈。虽然现有基准通过扩展视频时长推动了进展,但其评估任务往往仅需理解短暂且孤立的视频片段,难以捕捉超长上下文推理的挑战。为衡量这种认知负荷,我们强调连续证书长度(continuous certificate length),即人类必须连续观看的视频长度才能确定性地回答给定问题。基于此指标,我们引入VideoOdyssey,一个专为超长上下文和全模态视频理解设计的基准。VideoOdyssey具有三个关键特征:1)极端视频时长与多样性:覆盖11个领域和54个子类,平均视频时长为109分钟;2)全面评估场景:提供两个子集以针对不同研究重点,即VideoOdyssey-V用于探索大语言模型中视觉理解的极限,VideoOdyssey-AV用于评估全模态模型中同步音视频理解;3)超长与多层次连续证书:VideoOdyssey-V的平均连续证书延长至16分钟,VideoOdyssey-AV为12.8分钟。关键的是,我们设计了从秒到小时的5个细粒度层次,为在不同上下文长度和认知负荷下的模型提供了全面的诊断工具。广泛的评估表明,当前大语言模型的瓶颈不仅限于简单检索,还包括在不同上下文长度下的连续推理、细粒度感知以及非语言全模态理解方面的挑战。
引用
@article{arxiv.2605.22907,
title = {VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding},
author = {Haichen He and Jiayi Zhou and Sifeng Shang and Yihan Hu and Yuanhan Zhang and Kaiyang Zhou},
journal= {arXiv preprint arXiv:2605.22907},
year = {2026}
}