深度注意力驱动强化学习用于动态环境中的自主决策
人工智能
2024-10-01 v2 机器人学
摘要
城市环境中的自动驾驶车辆决策由于与周围车辆的动态交互而固有地具有挑战性。为了安全规划,自动驾驶车辆必须理解场景中各种时空交互的权重。当代工作使用庞大的Transformer架构来编码主要用于轨迹预测的交互,导致计算复杂度增加。为了解决这个问题而不损害时空理解和性能,我们提出了简单的深度注意力驱动强化学习框架,该框架动态地分配并将周围车辆的重要性纳入自我车辆的强化学习驱动的决策过程中。我们引入了一种以自动驾驶车辆为中心的时空注意力编码机制,用于学习与不同周围车辆的动态交互。为了理解地图和路线上下文,我们使用上下文编码器从上下文地图中提取特征。时空表示与上下文编码相结合提供了全面的状态表示。得到的模型使用软演员-评论家算法进行训练。我们在没有交通信号的SMARTS城市基准测试场景上评估了所提出的框架,以证明深度注意力驱动强化学习优于最近的最先进方法。此外,消融研究强调了上下文编码器和时空注意力编码器在实现卓越性能中的重要性。
引用
@article{arxiv.2407.08932,
title = {Deep Attention Driven Reinforcement Learning (DAD-RL) for Autonomous Decision-Making in Dynamic Environment},
author = {Jayabrata Chowdhury and Venkataramanan Shivaraman and Sumit Dangi and Suresh Sundaram and P. B. Sujit},
journal= {arXiv preprint arXiv:2407.08932},
year = {2024}
}
备注
6 pages, 3 figures