中文

BRAC+:改进的行为正则化 Actor Critic 离线强化学习方法

机器学习 2021-10-05 v1

摘要

由于经济和安全方面的考虑,与环境在线交互以收集训练强化学习(RL)智能体的数据样本并非总是可行。离线强化学习的目标是利用先前收集的数据集学习有效策略来解决此问题。标准的离策略 RL 算法容易高估分布外(较少被探索的)动作的价值,因此不适合离线 RL。行为正则化将学习到的策略约束在数据集的支持集内,已被提出以应对标准离策略算法的局限。在本文中,我们改进了行为正则化离线强化学习并提出 BRAC+。首先,我们提出对分布外动作进行量化,并比较使用 Kullback-Leibler 散度与最大均值差异作为正则化协议。我们提出以 KL 散度的解析上界作为行为正则化项,以降低基于样本估计的方差。其次,我们从数学上证明,即使在温和假设下使用行为正则化策略更新,学习到的 Q 值也可能发散。这会导致 Q 值的严重高估以及所学策略的性能退化。为缓解此问题,我们在策略评估目标中加入了梯度惩罚项。如此一来,Q 值得以保证收敛。在具有挑战性的离线 RL 基准上,BRAC+ 比基线行为正则化方法高出 40%~87%,比最先进方法高出 6%。

关键词

引用

@article{arxiv.2110.00894,
  title  = {BRAC+: Improved Behavior Regularized Actor Critic for Offline Reinforcement Learning},
  author = {Chi Zhang and Sanmukh Rao Kuppannagari and Viktor K Prasanna},
  journal= {arXiv preprint arXiv:2110.00894},
  year   = {2021}
}

备注

16 pages. Accepted by ACML21