面向函数近似鲁棒强化学习的自然 actor-critic
机器学习
2023-12-12 v2 机器人学
最优化与控制
摘要
我们研究鲁棒强化学习 (RL),目标是确定一种表现良好且对训练模拟器与测试环境之间的模型失配具有鲁棒性的策略。以往的基于策略的鲁棒 RL 算法主要关注于便于鲁棒策略评估的不确定性集下的表格设置,但当状态数量增大时不再可处理。为此,我们提出了两种新的不确定性集表述,一种基于双重采样,另一种基于积分概率度量。两者都使得大规模鲁棒 RL 即使仅能访问模拟器时也变得可处理。我们提出了一种鲁棒自然 actor-critic (RNAC) 方法,其结合了新不确定性集并采用函数近似。我们为所提出的 RNAC 算法提供了在函数近似误差范围内收敛到最优鲁棒策略的有限时间保证。最后,我们在多个 MuJoCo 环境和真实世界的 TurtleBot 导航任务中展示了我们提出的 RNAC 方法所学策略的鲁棒性能。
引用
@article{arxiv.2307.08875,
title = {Natural Actor-Critic for Robust Reinforcement Learning with Function Approximation},
author = {Ruida Zhou and Tao Liu and Min Cheng and Dileep Kalathil and P. R. Kumar and Chao Tian},
journal= {arXiv preprint arXiv:2307.08875},
year = {2023}
}
备注
Neurips 2023