中文

VideoLoom:用于联合时空理解的视频大语言模型

计算机视觉与模式识别 2026-01-13 v1

摘要

本文提出了VideoLoom,一个统一的视频大语言模型(Video LLM),用于联合时空理解。为了促进细粒度时空定位能力的发展,我们策划了LoomData-8.7k,一个具有时间锚定和空间定位描述的人类中心视频数据集。凭借此数据集,VideoLoom在多种空间和时间基准测试中取得了最先进或极具竞争力的性能(例如,在ReVOS上用于指代视频对象分割的J&F为63.1,在Charades-STA上用于时间定位的[email protected]为48.3)。此外,我们引入了LoomBench,一个由时间、空间和组合性视频-问题对组成的新型基准测试,能够从多个方面对Video LLM进行全面评估。总的来说,这些贡献为联合时空视频理解提供了一个通用且有效的工具集,为多模态智能设立了新标准。

关键词

引用

@article{arxiv.2601.07290,
  title  = {VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding},
  author = {Jiapeng Shi and Junke Wang and Zuyao You and Bo He and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2601.07290},
  year   = {2026}
}