中文

分布式鲁棒自定步课程强化学习

机器学习 2026-03-10 v3

摘要

强化学习的一个核心挑战是,在受控环境中训练的策略在部署到真实世界环境中时,常因分布偏移而失效。分布式鲁棒强化学习(DRRL)通过在由鲁棒性预算 ϵ\epsilon 定义的不确定性集中优化最差情况性能来解决此问题。然而,固定 ϵ\epsilon 会导致性能与鲁棒性之间的权衡:较小的值产生高标称性能但鲁棒性弱,而较大的值可能导致不稳定和过度保守的策略。我们提出分布式鲁棒自定步课程强化学习(DR-SPCRL),一种通过将 ϵ\epsilon 视为连续课程来克服此限制的方法。DR-SPCRL 根据智能体的进展自适应地调度鲁棒性预算,在标称性能与鲁棒性能之间实现平衡。多个环境中的实验结果表明,DR-SPCRL 不仅稳定了训练,还实现了更优的鲁棒性-性能权衡,与固定或启发式调度策略相比,在不同扰动下回合回报平均提升 11.8%,并达到相应标称 RL 算法约 1.9 倍的性能。

关键词

引用

@article{arxiv.2511.05694,
  title  = {Distributionally Robust Self Paced Curriculum Reinforcement Learning},
  author = {Anirudh Satheesh and Keenan Powell and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2511.05694},
  year   = {2026}
}