中文

TextVidBench:用于长视频场景文本理解的基准

计算机视觉与模式识别 2025-06-06 v1

摘要

尽管近期进展在短视频文本视觉问答(ViteVQA)任务中取得显著成果——主要受M4-ViteVQA等基准推动——现有数据集仍存在视频时长有限和评估范围狭窄的问题,难以充分评估强大多模态大语言模型(MLLM)的能力。为此,我们引入TextVidBench,首个专为长视频文本问答(>3分钟)设计的基准。TextVidBench作出三大贡献:1)跨域长视频覆盖范围:涵盖9类主题(如新闻、体育、游戏),平均视频长度为2306秒,实现更真实的长视频理解评估。2)三阶段评估框架:“文本穿透层->时空定位->文本动态描述”。3)高质量细粒度标注:包含5000多组问答对,具详尽语义标注。此外,我们提出了提高大型模型性能的有效范式:(i)引入IT-Rope机制和时序 prompt engineering 以增强时序感知;(ii)采用非均匀位置编码以更好处理长视频序列;(iii)对视频-文本数据应用轻量级 fine-tuning。在多个公开数据集以及TextVidBench上的大量实验表明,我们新的基准对现有模型构成显著挑战,而我们提出的方法为提高长视频场景文本理解能力提供了有价值的见解。

关键词

引用

@article{arxiv.2506.04983,
  title  = {TextVidBench: A Benchmark for Long Video Scene Text Understanding},
  author = {Yangyang Zhong and Ji Qi and Yuan Yao and Pengxin Luo and Yunfeng Yan and Donglian Qi and Zhiyuan Liu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2506.04983},
  year   = {2025}
}