稀疏威胁、聚焦防御:面向安全自主驾驶的关键性感知鲁棒强化学习
偏微分方程分析
2026-01-06 v1 数值分析
数值分析
摘要
强化学习 (RL) 在自主驾驶 (AD) 中展现出巨大的潜力,但其对扰动的脆弱性仍是现实部署的关键障碍。作为主要补救措施,对抗训练通过在对抗者刻意引入扰动的情况下训练 AD 代理来提高政策鲁棒性。现有方法通常将交互建模为零和博弈,持续攻击,但这些设计忽略了代理人与对手人之间的内在非对称性,导致实现的鲁棒性不足以满足实际 AD 场景的需求。为此,我们引入关键性感知鲁棒 RL (CARRL),一种用于处理自主驾驶中稀疏、安全关键风险的新型对抗训练方法。CARRL 由两个相互作用的组件构成:风险暴露对手 (REA) 和风险靶向稳健代理 (RTRA)。我们将 REA 与 RTRA 的交互建模为一般型博弈,使 REA 能够聚焦于暴露安全关键故障(如碰撞),而 RTRA 学习在安全与驾驶效率之间进行权衡。REA 采用解耦优化机制,在受限预算下更好地识别和利用稀疏的安全关键时刻。然而,这种聚焦攻击不可避免地导致对抗数据稀缺。RTRA 通过联合利用良性和对抗经验的双回放缓冲区来应对稀缺性,并在扰动下强制政策一致性以稳定行为。实验结果表明,与最先进的基准方法相比,我们的方法在所有案例中将碰撞率降低至少 22.66%。
引用
@article{arxiv.2601.01799,
title = {Self-Similar Solutions and Global Existence for Nonlinear Reaction-Diffusion Systems in Industrial Ammonia Synthesis},
author = {Jamshid Khasanov and Sokhibjan Muminov and Sardor Jumaniyozov and Oybek Djabborov and Khudayberganov Shuhrat},
journal= {arXiv preprint arXiv:2601.01799},
year = {2026}
}
备注
15 pages, numerical simulations, Keywords: Nonlinear parabolic systems; Reaction-diffusion; Ammonia production; Self-similar reduction; Global solutions; Asymptotic expansions