中文

ScaleLong:面向长视频理解的多时间尺度基准

计算机视觉与模式识别 2025-06-02 v1 计算与语言

摘要

尽管长视频理解要求模型捕获层次化的时间信息——从片段(秒)和镜头(数十秒)到事件(分钟)和故事(小时)——但现有基准要么忽略了这种多尺度设计,要么将特定尺度的问题分散在不同的视频中,从而无法在同一内容上直接比较模型在不同时间尺度上的性能。为了解决这个问题,我们引入了ScaleLong,这是第一个通过在相同的视频内容中嵌入针对四个层次化时间尺度——片段(秒)、镜头(数十秒)、事件(分钟)和故事(小时)——的问题来解耦这些因素的基准。这种内容内多时间尺度提问设计使得能够在相同视频上直接比较模型在不同时间尺度上的性能。ScaleLong包含来自5个主类别和36个子类别的269个长视频(平均86分钟),每个视频有4-8个精心设计的问题,每个时间尺度至少有一个问题。对23个MLLM的评估揭示了U型性能曲线,在最短和最长的时间尺度上准确率较高,而在中间水平上出现下降。此外,消融研究表明,增加视觉token容量能持续增强所有时间尺度上的推理能力。ScaleLong为提升MLLM在长视频理解方面的能力提供了一个细粒度的多时间尺度基准。代码和数据集可在 https://github.com/multimodal-art-projection/ScaleLong 获取。

关键词

引用

@article{arxiv.2505.23922,
  title  = {ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding},
  author = {David Ma and Huaqing Yuan and Xingjian Wang and Qianbo Zang and Tianci Liu and Xinyang He and Yanbin Wei and Jiawei Guo and Ni Jiahui and Zhenzhu Yang and Meng Cao and Shanghaoran Quan and Yizhi Li and Wangchunshu Zhou and Jiaheng Liu and Wenhao Huang and Ge Zhang and Shiwen Ni and Xiaojie Jin},
  journal= {arXiv preprint arXiv:2505.23922},
  year   = {2025}
}