中文

VideoWeave:一种高效视频理解的数据主导方法

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

训练视频语言模型往往因处理长序列帧和缺乏标注长视频数据的高成本而昂贵。我们提出 VideoWeave,一种简洁且有效的方法,通过构建拼接现有数据集中短小且带描述的视频,以合成长上下文训练样本来提高数据效率。该方法无需修改模型架构或优化目标,VideoWeave 重新组织现有视频文本对,扩大固定计算资源下的时序多样性。我们系统研究了不同的数据组成策略(如随机拼接与视觉聚类拼接,以及描述丰富化)对下游视频问答性能的影响。在相同的计算约束下,采用 VideoWeave 训练的模型在准确率上优于常规视频微调方法。我们的结果表明,重新组织训练数据而非改变网络结构,可能为训练视频语言模型提供一条简单且可扩展的路径。我们在此链接实验代码。

关键词

引用

@article{arxiv.2601.06309,
  title  = {VideoWeave: A Data-Centric Approach for Efficient Video Understanding},
  author = {Zane Durante and Silky Singh and Arpandeep Khatua and Shobhit Agarwal and Reuben Tan and Yong Jae Lee and Jianfeng Gao and Ehsan Adeli and Li Fei-Fei},
  journal= {arXiv preprint arXiv:2601.06309},
  year   = {2026}
}