强化学习中的 Expectile 引导
机器学习
2024-06-07 v1 人工智能
摘要
许多经典强化学习 (RL) 算法依赖 Bellman 算子,该算子涉及对下一状态的期望,从而产生 bootstrapping 概念。为引入一种乐观性,我们提出用 expectile 替代该期望。在实践中,这可以通过仅替换 critic 的 损失为更通用的 expectile 损失来实现。引入乐观性于 RL 具有多种优势,例如解决经典方法难以解决的 overestimation 问题(double Q-learning 或 TD3 的 twin-critic 方法),或用于 robust RL(其中转移状态受对手制约)。我们对这两种情形进行经验研究。对于 overestimation 问题,我们表明提出的方法 ExpectRL 在经典 twin-critic 基础上性能更佳。在涉及环境变化的 robust RL 基准测试中,我们表明该方法在鲁棒性上优于经典 RL 算法。我们还引入了 ExpectRL 的一种变体,结合 domain randomization,性能与最先进的 robust RL 智能体相当。最终,我们还扩展了 ExpectRL,引入一种自动选择 expectile 值的机制,即乐观性的程度。
引用
@article{arxiv.2406.04081,
title = {Bootstrapping Expectiles in Reinforcement Learning},
author = {Pierre Clavier and Emmanuel Rachelson and Erwan Le Pennec and Matthieu Geist},
journal= {arXiv preprint arXiv:2406.04081},
year = {2024}
}