超越标量奖励:基于预排序目标的分布式强化学习在安全可靠自动驾驶中的应用
机器人学
2026-03-24 v1 人工智能
机器学习
摘要
自动驾驶涉及多个常常相互冲突的目标,如安全、效率和舒适度。在强化学习(RL)中,这些目标通常通过加权求和来组合,这会导致它们的相对优先级被压缩,往往产生违反安全关键约束的政策。为克服这一局限,我们引入了 Preordered Multi-Objective MDP( Pr-MOMDP),它在标准 MOMDP 的基础上加入了奖励成分的预排序结构。这种结构使我们能够针对目标的层次结构而非标量信号来推理行动。为使这种结构可操作,我们将分布式 RL 扩展引入一种新颖的两两比较度量——Quantile Dominance( QD),用于在不将其归约为单个统计量的情况下评估行动返回分布。基于 QD,我们提出了一种用于提取最优子集的算法,即在每个目标下保持非支配的行动子集,这允许优先级信息塑造决策和训练目标。我们的框架以隐式分位网络( IQN) 实现,建立了具体实现,同时保持与广泛类分布式 RL 方法的兼容性。在 Carla 实验中,我们在成功率、碰撞和越野事件方面均取得改善,交付的政策在统计上更为稳健,优于 IQN 和 ensemble-IQN 基准。通过确保政策遵守奖励预排序,我们的工作推动了更安全、更可靠的自动驾驶系统的发展。
引用
@article{arxiv.2603.20230,
title = {Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving},
author = {Ahmed Abouelazm and Jonas Michel and Daniel Bogdoll and Philip Schörner and J. Marius Zöllner},
journal= {arXiv preprint arXiv:2603.20230},
year = {2026}
}
备注
First and Second authors contributed equally; Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)