LA-Pose: 潜在动作预训练与位姿估计的结合
计算机视觉与模式识别
2026-05-01 v1
摘要
本文通过自监督预训练的视角重新审视相机位姿估计,重点关注逆动力学预训练,将其作为当前使用 3D 标注进行全监督训练趋势的一种可扩展替代方案。具体来说,我们采用逆动力学和正动力学模型来学习潜在动作表示,类似于从大规模驾驶视频中学习的 Genie。我们的想法简单而有效。现有方法在其原始能力中使用潜在动作,即作为世界模型的动作条件或作为策略网络中机器人动作参数的代理。我们的方法,称为 LA-Pose,将潜在动作特征重新用作相机位姿估计器的输入,并在有限的高质量 3D 标注集上进行微调。这种公式化实现了准确且可泛化的位姿预测,同时保持了前馈效率。在驾驶基准上的大量实验表明,LA-Pose 在使用少几个数量级的标注数据的情况下,达到了与最先进方法相当甚至更优的性能。具体来说,在 Waymo 和 PandaSet 基准上,LA-Pose 的位姿精度比最近的前馈方法高出 10% 以上。据我们所知,这项工作是首次展示逆动力学自监督学习在姿态估计中的强大能力。
引用
@article{arxiv.2604.27448,
title = {LA-Pose: Latent Action Pretraining Meets Pose Estimation},
author = {Zhengqing Wang and Saurabh Nair and Prajwal Chidananda and Pujith Kachana and Samuel Li and Matthew Brown and Yasutaka Furukawa},
journal= {arXiv preprint arXiv:2604.27448},
year = {2026}
}
备注
Project page: https://la-pose.github.io/