ALLVB:一体化长视频理解基准
计算机视觉与模式识别
2025-04-02 v2
摘要
从图像理解到视频理解,多模态 LLM(MLLM)的能力日益强大。然而,大多数现有的视频理解基准相对较短,这使其不足以有效评估 MLLM 的长序列建模能力。这突出了对一个全面且集成的长视频理解基准以彻底评估 MLLM 能力的迫切需求。为此,我们提出了 ALLVB(一体化长视频理解基准)。ALLVB 的主要贡献包括:1)它集成了 9 个主要视频理解任务。这些任务被转换为视频 QA 格式,允许单个基准评估 MLLM 的 9 种不同视频理解能力,突出了 ALLVB 的多功能性、全面性和挑战性。2)设计了一个使用 GPT-4o 的全自动标注流水线,仅需人工质量控制,这有助于基准的维护和扩展。3)它包含跨越 16 个类别的 1,376 个视频,平均每个视频近 2 小时,总计 252k 个 QA。据我们所知,它是视频数量、平均持续时间和 QA 数量上最大的长视频理解基准。我们在 ALLVB 上测试了各种主流 MLLM,结果表明,即使是最先进的商业模型也有很大的改进空间。这反映了该基准的挑战性,并证明了长视频理解方面的巨大发展潜力。
引用
@article{arxiv.2503.07298,
title = {ALLVB: All-in-One Long Video Understanding Benchmark},
author = {Xichen Tan and Yuanjing Luo and Yunfan Ye and Fang Liu and Zhiping Cai},
journal= {arXiv preprint arXiv:2503.07298},
year = {2025}
}
备注
AAAI 2025