PosePilot:利用自监督深度为生成式世界模型操控相机位姿
计算机视觉与模式识别
2025-07-21 v2
摘要
自动驾驶(AD)系统的最新进展凸显了世界模型在普通和挑战性驾驶条件下实现鲁棒且可泛化性能的潜力。然而,一个关键挑战依然存在:精确且灵活的相机位姿控制,这对于准确的视角变换和场景动态的真实模拟至关重要。本文中,我们提出 PosePilot,一个轻量级但功能强大的框架,显著增强了生成式世界模型中的相机位姿可控性。受自监督深度估计的启发,PosePilot 利用运动恢复结构原理,在相机位姿与视频生成之间建立紧密耦合。具体而言,我们整合了自监督深度和位姿读出,使模型能够直接从视频序列中推断深度和相对相机运动。这些输出驱动位姿感知的帧变形,并由光度变形损失引导,该损失强制合成帧之间的几何一致性。为了进一步优化相机位姿估计,我们引入了一个反向变形步骤和一个位姿回归损失,从而提高了视角精度和适应性。在自动驾驶和通用领域视频数据集上的大量实验表明,PosePilot 显著增强了基于扩散和自回归世界模型中的结构理解和运动推理能力。通过利用自监督深度操控相机位姿,PosePilot 为位姿可控性设立了新的基准,使得在生成式世界模型中能够实现物理一致、可靠的视角合成。
引用
@article{arxiv.2505.01729,
title = {PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth},
author = {Bu Jin and Weize Li and Baihan Yang and Zhenxin Zhu and Junpeng Jiang and Huan-ang Gao and Haiyang Sun and Kun Zhan and Hengtong Hu and Xueyang Zhang and Peng Jia and Hao Zhao},
journal= {arXiv preprint arXiv:2505.01729},
year = {2025}
}
备注
Accepted at IEEE/RSJ IROS 2025