基于控制辅助注意力的端到端视觉自主停车
计算机视觉与模式识别
2025-11-25 v2
摘要
精确停车需要一个端到端的系统,其中感知能够适应性地提供与策略相关的细节——尤其是在需要精细控制决策的关键区域。在端到端的学习方法中,这一框架直接将传感器输入映射到控制动作,但现有方法缺乏感知与控制之间的有效协同作用。我们提出了 CAA-Policy,一种端到端的模仿学习系统,允许控制信号引导视觉注意力的学习,方法是通过一种新颖的控制辅助注意力(Control-Aided Attention, CAA)机制。我们以自监督方式训练注意力模块,使用来自控制输出的反向传播梯度,而非来自训练损失。这种策略鼓励注意力聚焦于导致动作输出方差较大的视觉特征,而不仅仅是最小化训练损失——我们证明,这一方法导致更稳健、更具可泛化性的策略。为进一步强化该框架,CAA-Policy 集成了短期视 waypoint 预测作为辅助任务,以提高控制输出的时间一致性,包含一个可学习的运动预测模块,以稳健地跟踪目标槽位,以及修改后的目标标记方案以实现更有效的特征融合。广泛的 CARLA 模拟器实验表明,CAA-Policy 在准确性、鲁棒性和可解释性方面均一致优于端到端学习基线和模块化 BEV 分段 + 混合 A* 管线。代码和收集的训练数据将发布。代码已在 https://github.com/ai4ce/CAAPolicy 发布。
引用
@article{arxiv.2509.11090,
title = {End-to-End Visual Autonomous Parking via Control-Aided Attention},
author = {Chao Chen and Shunyu Yao and Yuanwu He and Feng Tao and Ruojing Song and Yuliang Guo and Xinyu Huang and Chenxu Wu and Liu Ren and Chen Feng},
journal= {arXiv preprint arXiv:2509.11090},
year = {2025}
}