中文

强化学习中单步正则化与评论家正则化之间的联系

机器学习 2023-07-25 v1 人工智能

摘要

与任何数据有限的机器学习问题一样,有效的离线 RL 算法需要谨慎的正则化以避免过拟合。单步方法通过仅执行一步策略改进来进行正则化,而评论家正则化方法则通过正则化目标进行多步策略改进。这些方法看似不同。单步方法,如优势加权回归和条件行为克隆,在仅一步之后截断策略迭代。这种“早停”使单步 RL 简单且稳定,但可能限制其渐近性能。评论家正则化通常需要更多计算,但具有吸引人的下界保证。在本文中,我们揭示了这些方法之间的紧密联系:应用正则化系数为 1 的多步评论家正则化方法,会得到与单步 RL 相同的策略。尽管实际实现违背了我们的假设,且评论家正则化通常以较小的正则化系数应用,我们的实验仍表明,我们的分析对常用的超参数下实用离线 RL 方法(CQL 和单步 RL)做出了准确的、可检验的预测。我们的结果并非每个问题都能通过单步策略改进解决,而是表明在需要强正则化的 RL 问题上,单步 RL 可能与评论家正则化具有竞争力。

关键词

引用

@article{arxiv.2307.12968,
  title  = {A Connection between One-Step Regularization and Critic Regularization in Reinforcement Learning},
  author = {Benjamin Eysenbach and Matthieu Geist and Sergey Levine and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:2307.12968},
  year   = {2023}
}

备注

Accepted to ICML 2023. Video (https://www.youtube.com/watch?v=1xlixIHZ0R4) and code (https://github.com/ben-eysenbach/ac-connection)