用于交互式城市驾驶中罕见事件风险控制的伦理感知安全强化学习
机器学习
2025-11-10 v3 人工智能
机器人学
摘要
自动驾驶汽车在减少交通死亡人数和提高交通效率方面具有巨大前景,但其广泛采用取决于将可信且透明的伦理推理嵌入到日常和紧急操作中,特别是为了保护行人和骑行者等弱势道路使用者。在此,我们提出了一种分层安全强化学习框架,该框架通过伦理感知成本信号增强了标准驾驶目标。在决策层,使用结合了碰撞概率和伤害严重程度的复合伦理风险成本来训练 Safe RL 代理,以生成高级运动目标。动态的风险敏感优先经验回放机制放大了对罕见但关键的高风险事件的学习。在执行层,多项式路径规划结合比例-积分-微分(PID)和 Stanley 控制器将这些目标转化为平滑、可行的轨迹,确保了准确性和舒适性。我们在源自大规模真实世界交通数据集的闭环仿真环境中训练并验证了我们的方法,这些数据集包含多样化的车辆、骑行者和行人,并证明其在降低他人风险的同时,能保持自身性能和舒适性,优于基线方法。这项工作为在人类混合交通场景中具有显式伦理感知目标的 Safe RL 提供了可复现的基准。我们的结果突显了结合形式控制理论和数据驱动学习来推进伦理问责自主性的潜力,该自主性明确保护城市交通环境中风险最高的人群。在两个交互式基准和五个随机种子上,与任务成功率相匹配的情况下,我们的策略将冲突频率降低了 25-45%,同时将舒适度指标保持在 5% 以内。
引用
@article{arxiv.2508.14926,
title = {Ethics-Aware Safe Reinforcement Learning for Rare-Event Risk Control in Interactive Urban Driving},
author = {Dianzhao Li and Ostap Okhrin},
journal= {arXiv preprint arXiv:2508.14926},
year = {2025}
}