中文

基于自监督几何建模的自动驾驶策略预训练

计算机视觉与模式识别 2023-03-16 v2

摘要

目睹了预训练技术在计算机视觉和自然语言处理领域大规模数据上的令人印象深刻的成就,我们思考这一思路是否能以即取即用的精神被采纳,并缓解视觉运动驾驶的采样低效问题。鉴于输入的高度动态和多变性质,视觉运动驾驶任务天生缺乏视角和平移不变性,且视觉输入包含大量与决策无关的冗余信息,导致通用视觉中主流的预训练方法不太适用于自动驾驶任务。为此,我们提出 PPGeo(通过几何建模的策略预训练),一个为视觉运动驾驶中的策略预训练量身定制的直观且简洁的全自监督框架。我们旨在通过大规模无标签且未标定的 YouTube 驾驶视频上建模 3D 几何场景,来学习作为强大抽象的策略表示。所提出的 PPGeo 分两个阶段执行以支持有效的自监督训练。在第一阶段,几何建模框架以两连续帧作为输入,同时生成位姿和深度预测。在第二阶段,视觉编码器仅基于当前视觉观测,通过预测未来自运动并以光度误差优化来学习驾驶策略表示。如此,预训练的视觉编码器具备了丰富的驾驶策略相关表示,从而能胜任多种视觉运动驾驶任务。涵盖广泛挑战性场景的大量实验证明了我们提出方法的优越性,在数据极为有限的情况下改进幅度从 2% 到甚至超过 100%。

关键词

引用

@article{arxiv.2301.01006,
  title  = {Policy Pre-training for Autonomous Driving via Self-supervised Geometric Modeling},
  author = {Penghao Wu and Li Chen and Hongyang Li and Xiaosong Jia and Junchi Yan and Yu Qiao},
  journal= {arXiv preprint arXiv:2301.01006},
  year   = {2023}
}

备注

ICLR2023