面向最坏情形模型误设鲁棒性的最大最小离屏Actor-Critic方法
机器学习
2023-01-12 v2 人工智能
摘要
在强化学习领域,由于现实世界中策略训练成本高且风险大,策略通常在仿真环境中训练并迁移到相应的现实环境中。然而,仿真环境并不能完美模拟现实环境,从而导致模型误设。多项研究报道了策略在现实环境中性能的显著退化。在本研究中,我们关注包含不确定性参数及其可能取值集合(称为不确定性参数集)的仿真环境场景。目标是在不确定性参数集上优化最坏情形性能,以保证在相应现实环境中的表现。为获得用于该优化的策略,我们提出一种称为最大最小双延迟深度确定性策略梯度算法(M2TD3)的离屏actor-critic方法,其采用同步梯度上升下降方法求解最大最小优化问题。在多关节接触动力学(MuJoCo)环境中的实验表明,所提方法的最坏情形性能优于若干基线方法。
引用
@article{arxiv.2211.03413,
title = {Max-Min Off-Policy Actor-Critic Method Focusing on Worst-Case Robustness to Model Misspecification},
author = {Takumi Tanabe and Rei Sato and Kazuto Fukuchi and Jun Sakuma and Youhei Akimoto},
journal= {arXiv preprint arXiv:2211.03413},
year = {2023}
}
备注
Neural Information Processing Systems 2022 (NeurIPS '22)