面向安全自动驾驶的注意力与风险感知决策框架
机器人学
2025-09-10 v1
摘要
自动驾驶因其全无人监督驾驶的潜在能力而引起了极大兴趣。基于模型和基于学习的方法被广泛应用于自动驾驶。基于模型的方法依赖于预定义的环境模型,可能难以应对不可预见的事件。近端策略优化(PPO)作为一种先进的基于学习的方法,可以通过与环境交互进行学习来适应上述限制。然而,现有的 PPO 在长序列中面临训练结果差和训练效率低的挑战。此外,糟糕的训练结果在驾驶任务中等同于碰撞。为了解决这些问题,本文通过引入风险感知机制、风险注意力决策网络、平衡奖励函数和安全辅助机制,开发了一种改进的 PPO。风险感知机制侧重于突出潜在碰撞区域,促进 PPO 的安全驾驶学习。平衡奖励函数根据周围车辆数量调整奖励,促进训练期间控制策略的高效探索。此外,风险注意力网络增强了 PPO,使其对输入图像的高风险区域保持通道和空间注意力。而且,安全辅助机制在车道保持和车道变换期间监督并防止有碰撞风险的动作。在物理引擎上的仿真结果表明,所提出的算法在避碰方面优于基准算法,在多种测试交通流场景中以更少的训练时间实现了更高的峰值奖励,并且在风险区域上的行驶时间更短。
引用
@article{arxiv.2509.07412,
title = {Attention and Risk-Aware Decision Framework for Safe Autonomous Driving},
author = {Zhen Tian and Fujiang Yuan and Yangfan He and Qinghao Li and Changlin Chen and Huilin Chen and Tianxiang Xu and Jianyu Duan and Yanhong Peng and Zhihao Lin},
journal= {arXiv preprint arXiv:2509.07412},
year = {2025}
}