VideoOrion:视频中对象动态的标记化
计算机视觉与模式识别
2025-03-19 v2 机器学习
摘要
我们提出VideoOrion,一种能够显式捕获视频中关键语义信息——对象在整个视频中的时空动态的视频大型语言模型(Video-LLM)。VideoOrion采用专家视觉模型通过检测-分割-跟踪管线提取对象动态,将其编码为一组通过聚合时空对象特征而生成的对象标记。我们的方法解决了Video-LLM在高效压缩高维视频数据以生成LLM可理解的语义标记方面的持续挑战。与采用下采样原始视频或使用重采样器聚合视觉标记、导致信息丢失和语义交织的先前方法不同,VideoOrion不仅提供了一种更自然且高效地从紧凑且解耦的语义表示中派生对象的方式,还能够以最小的计算成本实现对视频内容的显式对象建模。此外,引入的对象标记自然地使VideoOrion能够完成基于视频的指代任务。实验结果表明,VideoOrion能够学习有效地利用对象标记,在通用视频问答和视频指代基准测试中取得具竞争力的成绩。
引用
@article{arxiv.2411.16156,
title = {VideoOrion: Tokenizing Object Dynamics in Videos},
author = {Yicheng Feng and Yijiang Li and Wanpeng Zhang and Hao Luo and Zihao Yue and Sipeng Zheng and Zongqing Lu},
journal= {arXiv preprint arXiv:2411.16156},
year = {2025}
}