面向多车道场景自动驾驶的编码分布式软 actor-critic 方法
机器人学
2021-09-14 v1 系统与控制
系统与控制
摘要
本文提出一种新的强化学习(RL)算法,称为编码分布式软 actor-critic(E-DSAC),用于自动驾驶中的决策。与现有的基于 RL 的决策方法不同,E-DSAC 适用于周围车辆数量可变的情况,并消除了对手动预先设计排序规则的需求,从而获得了更高的策略性能与泛化能力。我们首先通过嵌入一个置换不变模块,将特征神经网络(NN)用于编码每辆车的指标,融入分布式 RL 框架中,从而发展了编码分布式策略迭代(DPI)框架。所提出的 DPI 框架被证明在收敛性与全局最优性方面具有重要性质。接着,基于所发展的编码 DPI 框架,我们通过将特征 NN 的基于梯度的更新规则加入 DSAC 算法的策略评估过程,提出了 E-DSAC 算法。然后,设计了多车道驾驶任务及相应的奖励函数以验证所提算法的有效性。结果表明,E-DSAC 学到的策略能在所设计场景中实现高效、平顺且相对安全的自动驾驶,且 E-DSAC 学到的最终策略性能约为 DSAC 的三倍。此外,其有效性也在实车实验中得到了验证。
引用
@article{arxiv.2109.05540,
title = {Encoding Distributional Soft Actor-Critic for Autonomous Driving in Multi-lane Scenarios},
author = {Jingliang Duan and Yangang Ren and Fawang Zhang and Yang Guan and Dongjie Yu and Shengbo Eben Li and Bo Cheng and Lin Zhao},
journal= {arXiv preprint arXiv:2109.05540},
year = {2021}
}