面向自动驾驶视觉深度强化学习的离线训练编码器研究
计算机视觉与模式识别
2024-09-18 v1 人工智能
摘要
我们的研究探讨了深度强化学习(DRL)在复杂的部分可观测马尔可夫决策过程(POMDP)(如自动驾驶(AD))中面临的挑战,并提出了在这些环境中进行视觉导航的解决方案。部分可观测性显著降低了 RL 的性能,这可以通过增加传感器信息和数据融合以反映更具马尔可夫性质的环境来缓解。然而,这需要一个日益复杂的感知模块,而由于固有的局限性,通过 RL 训练该模块变得复杂。随着神经网络架构变得更加复杂,奖励函数作为误差信号的有效性会降低,因为监督的唯一来源是奖励,而奖励通常是嘈杂、稀疏和延迟的。图像中与任务无关的元素(如天空或某些物体)带来了额外的复杂性。我们的研究采用离线训练的编码器,通过自监督学习利用大型视频数据集来学习可泛化的表示。然后,我们通过 DRL 在这些表示之上训练一个头部网络,以学习在 CARLA AD 模拟器中控制本车。本研究广泛调查了编码器离线训练的不同学习方案对 DRL 智能体在具有挑战性的 AD 任务中性能的影响。此外,我们表明,通过观看 BDD100K 驾驶视频学到的特征可以以零样本学习的方式直接迁移到 CARLA 模拟器中,以实现车道保持和碰撞避免。最后,我们探讨了 RL 网络的各种架构决策对有效利用迁移表示的影响。因此,在这项工作中,我们引入并验证了一种获取环境合适表示并将其迁移到 RL 网络的最佳方法。
引用
@article{arxiv.2409.10554,
title = {An Examination of Offline-Trained Encoders in Vision-Based Deep Reinforcement Learning for Autonomous Driving},
author = {Shawan Mohammed and Alp Argun and Nicolas Bonnotte and Gerd Ascheid},
journal= {arXiv preprint arXiv:2409.10554},
year = {2024}
}