面向理解任意视频中摄像机运动的研究
计算机视觉与模式识别
2025-09-01 v2 人工智能
计算与语言
机器学习
多媒体
摘要
我们引入 CameraBench,一个大规模数据集和基准,旨在评估和改进摄像机运动理解能力。CameraBench 包含约 3000 个多样化的互联网视频,经专家通过严格的多阶段质量控制过程标注。我们的贡献之一是与影视制作人合作设计的摄像机运动原语分类。我们发现,例如,某些运动如“跟随”(或跟踪)需要理解场景内容中的移动主体。我们进行大规模人类研究,量化了人类标注性能,发现领域专业知识和基于教程的训练能显著提升准确性。例如,初学者可能会将 zoom-in(内参变化)与向前移动(外参变化)混淆,但经过训练后即可区分这两者。使用 CameraBench,我们评估了 Structure-from-Motion (SfM) 和 Video-Language Models (VLMs),发现 SfM 模型难以捕获依赖场景内容的语义原语,而 VLMs 则难以捕获需要精确轨迹估计的几何原语。我们随后在 CameraBench 上微调生成式 VLM,以实现两者兼备,并展示了其应用,包括运动增强的描述、视频问答和视频文本检索。我们希望我们的分类、基准和教程将推动未来工作,最终实现对任意视频中摄像机运动的理解。
引用
@article{arxiv.2504.15376,
title = {Towards Understanding Camera Motions in Any Video},
author = {Zhiqiu Lin and Siyuan Cen and Daniel Jiang and Jay Karhade and Hewei Wang and Chancharik Mitra and Tiffany Ling and Yuhan Huang and Sifan Liu and Mingyu Chen and Rushikesh Zawar and Xue Bai and Yilun Du and Chuang Gan and Deva Ramanan},
journal= {arXiv preprint arXiv:2504.15376},
year = {2025}
}
备注
Project site: https://linzhiqiu.github.io/papers/camerabench/