从真实无人机视频中学习相机运动控制
计算机视觉与模式识别
2024-12-13 v1 机器人学
摘要
本研究旨在自动化相机运动控制,将现有主题录制的素材转化为引人注目的视频,区别于直接生成像素来创建不存在的内容。我们选取无人机视频作为测试案例,由于其丰富且具有挑战性的运动模式、独特的观察角度以及精确的控制能力。现有的AI摄影方法面临训练数据中外观多样性有限、录制专家操作成本高以及难以设计覆盖所有场景的启发式目标等问题。为避免这些问题,我们提出了可扩展的方法:收集真实世界训练数据以提升多样性、自动提取相机轨迹以降低标注成本、以及训练无需依赖启发式设计的有效架构。具体而言,我们通过对在线视频进行3D重建收集了99k条高质量轨迹,将连续帧的相机姿态连接构成3D相机路径,并利用卡尔曼滤波识别并删除低质量数据。此外,我们引入DVGFormer,一种自回归变压器,利用所有过去帧的相机路径和图像,预测下一帧的相机运动。我们在38个合成自然场景和7个真实城市3D扫描上评估了该系统。我们展示了该系统能够有效学习执行各种具有挑战性的相机运动,如穿越障碍物、维持低飞行高度以增加 perceived speed,以及围绕塔楼和建筑物旋转,这些都是录制高质量视频的实用技巧。数据和代码已在dvgformer.github.io提供。
引用
@article{arxiv.2412.09620,
title = {Learning Camera Movement Control from Real-World Drone Videos},
author = {Yunzhong Hou and Liang Zheng and Philip Torr},
journal= {arXiv preprint arXiv:2412.09620},
year = {2024}
}