中文

通过高效对抗群聚实现鲁棒强化学习

机器学习 2023-06-14 v1 人工智能 机器人学

摘要

尽管强化学习(RL)被视为策略设计的黄金标准,其在多种场景下未必总能给出鲁棒解。当环境暴露于潜在扰动时,这可能导致严重的性能退化。基于双人极大极小博弈的对抗训练已被证明能有效提升 RL 智能体的鲁棒性。本工作中,我们引入对抗群(即一组对抗者)来扩展双人博弈,以解决(i\textit{i})内部优化问题的困难,以及(ii\textit{ii})因候选对抗者集可能包含不大可能出现的场景而导致的潜在过度悲观。我们首先证明对抗群可高效近似内部优化问题。随后,我们将内部优化中的最坏情况性能替换为最差-kk 个对抗者的平均性能,以解决第二个问题。我们在多个 MuJoCo 环境中评估了所提方法。实验结果表明,我们的方法持续生成更鲁棒的策略。

关键词

引用

@article{arxiv.2306.07408,
  title  = {Robust Reinforcement Learning through Efficient Adversarial Herding},
  author = {Juncheng Dong and Hao-Lun Hsu and Qitong Gao and Vahid Tarokh and Miroslav Pajic},
  journal= {arXiv preprint arXiv:2306.07408},
  year   = {2023}
}