TCRL:面向最坏情形的鲁棒约束强化学习的时序耦合对抗训练
机器学习
2026-02-16 v1
摘要
约束强化学习(CRL)旨在约束条件下优化决策策略,具有高度适用性,如自动驾驶、机器人和电网管理等安全关键领域。然而,现有鲁棒 CRL 方法主要关注单步扰动和时序独立的对抗模型,缺乏对时序耦合扰动的鲁棒性建模。为此,我们提出了 TCRL,即面向最坏情形的鲁棒约束强化学习的时序耦合对抗训练框架(TCRL)。首先,TCRL 引入一种最坏情况感知成本约束函数,在无需显式建模对抗攻击者的情况下估计时序耦合扰动下的安全成本。其次,TCRL 在奖励上建立双约束防御机制,以抵御时序耦合对手,同时保持奖励不可预测性。实验结果表明,TCRL 在多种 CRL 任务中均在抵御时序耦合扰动攻击方面 consistently 优于现有方法。
引用
@article{arxiv.2602.13040,
title = {TCRL: Temporal-Coupled Adversarial Training for Robust Constrained Reinforcement Learning in Worst-Case Scenarios},
author = {Wentao Xu and Zhongming Yao and Weihao Li and Zhenghang Song and Yumeng Song and Tianyi Li and Yushuai Li},
journal= {arXiv preprint arXiv:2602.13040},
year = {2026}
}