XVO:基于跨模态自训练的广义视觉里程计
计算机视觉与模式识别
2023-10-10 v3 人工智能
机器人学
摘要
我们提出XVO,一种半监督学习方法,用于训练广义单目视觉里程计(VO)模型,可在多样数据集与设置下实现鲁棒的即用型运行。与通常研究单一数据集内已知标定的标准单目VO方法不同,XVO高效地从视觉场景语义中恢复具真实世界尺度的相对位姿,即不依赖任何已知相机参数。我们通过自训练从YouTube上大量无约束且异构的行车记录仪视频优化运动估计模型。我们的关键贡献有两点。首先,我们实证展示了半监督训练对学习通用直接VO回归网络的好处。其次,我们展示了多模态监督(包括分割、光流、深度与音频辅助预测任务)以促进VO任务的广义表征。具体而言,我们发现音频预测任务显著增强了半监督学习过程,同时在高度动态与域外视频数据中缓解噪声伪标签。我们提出的教师网络在常用KITTI基准上取得最先进性能,尽管无多帧优化或相机参数知识。结合所提半监督步骤,XVO在KITTI、nuScenes与Argoverse上展示了跨多样条件的即用型知识迁移而无需微调。
引用
@article{arxiv.2309.16772,
title = {XVO: Generalized Visual Odometry via Cross-Modal Self-Training},
author = {Lei Lai and Zhongkai Shangguan and Jimuyang Zhang and Eshed Ohn-Bar},
journal= {arXiv preprint arXiv:2309.16772},
year = {2023}
}
备注
ICCV 2023, Paris https://genxvo.github.io/