中文

基于几何引导的视频 LLM 相机运动理解

计算机视觉与模式识别 2026-03-26 v2 人工智能

摘要

相机运动是塑造视觉感知和电影风格的基本几何信号,然而当前的视频能力视觉语言模型(VideoLLMs)很少显式地表示它,常常在细粒度运动原语上失败。为填补这一差距,我们提出了一个包含 基准构建\textbf{基准构建}诊断\textbf{诊断}注入\textbf{注入} 的框架。我们构建了 CameraMotionDataset\textbf{CameraMotionDataset},一个大规模人工合成数据集,配备显式相机控制, 将相机运动建模为约束感知的多标签识别问题,并构建了一个 VQA 基准——CameraMotionVQA\textbf{CameraMotionVQA}。在多种主流 VideoLLMs 上,我们观察到识别相机运动原语的错误率相当大。探针实验表明,Qwen2.5-VL 视觉编码器中,相机运动线索的表征较弱,尤其在更深的 ViT 块中,帮助解释了观察到的失败模式。为在不高成本地训练或微调的情况下弥合这一差距,我们提出了一个轻量级、模型无关的管道,从 3D 基础模型(3DFMs)中提取几何相机线索,使用时间分类器预测受约束的运动原语,并通过结构化提示注入到下游 VideoLLM 推理中。实验表明,这种方法在运动识别和更具相机感知性的模型响应方面均取得了改进,凸显了几何驱动的线索提取和结构化提示作为通向相机感知 VideoLLM 和 VLA 系统的实用步骤。该数据集和基准可在 https://hf.co/datasets/fengyee/camera-motion-dataset-and-benchmark 查阅。

关键词

引用

@article{arxiv.2603.13119,
  title  = {Geometry-Guided Camera Motion Understanding in VideoLLMs},
  author = {Haoan Feng and Sri Harsha Musunuri and Guan-Ming Su},
  journal= {arXiv preprint arXiv:2603.13119},
  year   = {2026}
}

备注

10 pages, 7 figures, supplementary included CVPR2026 PVUW