Centaur:基于测试时训练的鲁棒端到端自动驾驶
机器人学
2025-03-17 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
我们如何能在部署期间依赖端到端自动驾驶车辆复杂的决策系统?一种常见的解决方案是设置一个“后备层”,检查规划轨迹是否违反规则,并在必要时用预定义的安全动作将其替换。另一种方法是利用道路布局和检测到的障碍物等附加系统预测,调整规划器的决策以最小化预定义的“代价函数”。然而,这些预编程的规则或代价函数无法通过新的训练数据进行学习和改进,往往导致过于保守的行为。在这项工作中,我们提出了 Centaur(基于不确定性测试时训练的聚类熵,Cluster Entropy for Test-time trAining using Uncertainty),它通过测试时训练来更新规划器的行为,而无需依赖手工设计的规则或代价函数。相反,我们测量并最小化规划器决策中的不确定性。为此,我们开发了一种名为 Cluster Entropy 的新型不确定性度量,它简单、可解释,且与 SOTA 规划算法兼容。利用在先前测试时步骤收集的数据,我们使用最小化 Cluster Entropy 的梯度对模型参数进行更新。仅在推理前进行此单一梯度更新,Centaur 就展现出显著的性能提升,在 navtest 排行榜上排名第一,并在碰撞时间等安全关键指标上取得了显著改善。为了在逐场景的基础上提供详细洞察,我们还引入了 navsafe,一个具有挑战性的新基准,突出了驾驶模型此前未被发现的失败模式。
引用
@article{arxiv.2503.11650,
title = {Centaur: Robust End-to-End Autonomous Driving with Test-Time Training},
author = {Chonghao Sima and Kashyap Chitta and Zhiding Yu and Shiyi Lan and Ping Luo and Andreas Geiger and Hongyang Li and Jose M. Alvarez},
journal= {arXiv preprint arXiv:2503.11650},
year = {2025}
}