中文

CamReasoner:通过结构化空间推理强化相机运动理解

计算机视觉与模式识别 2026-04-15 v3 人工智能

摘要

理解相机动力学是视频空间智能的基本支柱。然而,现有多模态模型通常将此任务视为黑箱分类,常在依赖浅表视觉模式而非几何线索的情况下混淆物理上不同的运动。我们提出了CamReasoner框架,将相机运动理解重新表述为结构化推理过程,以弥合感知与电影逻辑之间的鸿沟。我们的方法以观察-思考-回答(Observation-Thinking-Answer, O-T-A)范式为核心,迫使模型在明确的推理块中阐述时空观察并对运动模式进行推理。为培育此能力,我们构建了大规模推理轨迹套件,包含18k条SFT推理链和38k条RL反馈样本。我们是首次在相机运动理解中运用RL进行逻辑对齐,确保运动推理基于结构化视觉推理而非情境猜测。基于Qwen2.5-VL-7B,CamReasoner-7B在二元分类准确率从73.8%提升至78.4%,VQA准确率从60.9%提升至74.5%,在多个基准测试中始终优于专有和开源基线。

关键词

引用

@article{arxiv.2602.00181,
  title  = {CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning},
  author = {Hang Wu and Yujun Cai and Zehao Li and Haonan Ge and Bowen Sun and Junsong Yuan and Yiwei Wang},
  journal= {arXiv preprint arXiv:2602.00181},
  year   = {2026}
}