中文

通过分数目标稳定对抗性深确定性策略梯度

机器学习 2026-03-13 v1 人工智能

摘要

强化学习在广泛的控制和决策任务中取得了显著成功。然而,RL 代理在部署于受意外外部扰动和模型不确定性约束的环境时,往往表现出不稳定或降级的性能。因此,确保在此类条件下的可靠性能仍是一个关键挑战。本文提出了对抗性深确定性策略梯度 (MMDDPG),用于学习连续控制任务中的扰动鲁棒策略。将训练过程形式化为用户策略与对抗扰动策略之间的对抗优化问题。在该问题中,用户学习最小化目标函数的鲁棒策略,而对手生成最大化该目标函数的扰动。为稳定这种交互,我们引入一种分数目标,以平衡任务性能和扰动幅度。该目标防止过于激进的扰动,并促进稳健学习。在MuJoCo 环境中的实验评估表明,所提出的 MMDDPG 在对外部力扰动和模型参数变化都具有显著改善的鲁棒性。

关键词

引用

@article{arxiv.2603.12110,
  title  = {Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives},
  author = {Taeho Lee and Donghwan Lee},
  journal= {arXiv preprint arXiv:2603.12110},
  year   = {2026}
}