中文

Strefer:通过合成指令数据赋能视频 LLM 的空间时间指涉与推理

计算机视觉与模式识别 2025-09-04 v1 人工智能 人机交互 机器学习

摘要

下一代 AI 伴侣必须超越一般视频理解,才能解决动态真实环境中的空间和时间参考问题。虽然具备粗糙级理解能力的现有视频大语言模型(Video LLM),但在处理细粒度的时空推理时仍存在挑战,尤其是当用户查询依赖基于时间的事件参考进行时间锚定,或依赖基于手势的参考进行空间锚定以澄清对象参考和位置时。为弥合这一关键鸿沟,我们引入 Strefer,这是一个为赋能 Video LLM 具备时空指涉与推理能力而设计的合成指令数据生成框架。Strefer 通过一个数据引擎生成多样化的指令调优数据,对影像进行伪标注,捕获稠密的细粒度视频元数据,结构化地包含丰富的空间和时间信息,包括主体、客体、它们的位置(作为掩码块)以及动作描述和时间线。我们的 methods 增强了 Video LLM 解释空间和时间参考的能力,促进了更灵活、时空感知的推理,这对于真实世界的 AI 伴侣至关重要。不使用专有模型、昂贵的人类标注或标注大量新视频,实验评估表明,使用 Strefer 生成的数据训练的模型在需要空间和时间消歧义的任务上超越了基线方法。此外,这些模型表现出增强的时空感知推理能力,为感知导向、指令调优的 Video LLM 树立了新基准。

关键词

引用

@article{arxiv.2509.03501,
  title  = {Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data},
  author = {Honglu Zhou and Xiangyu Peng and Shrikant Kendre and Michael S. Ryoo and Silvio Savarese and Caiming Xiong and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2509.03501},
  year   = {2025}
}

备注

This technical report serves as the archival version of our paper accepted at the ICCV 2025 Workshop. For more information, please visit our project website: https://strefer.github.io/