中文

面向强化学习策略优化的自助优势估计

机器学习 2022-10-17 v1 人工智能

摘要

本文提出一种基于数据增强的优势估计方法用于策略优化。与现有方法在输入上使用数据增强来学习价值和策略函数不同,我们的方法利用数据增强计算自助优势估计(Bootstrap Advantage Estimation, BAE)。该自助优势估计随后被用于学习和更新策略与价值函数的梯度。为验证方法有效性,我们在多个环境上进行了实验。这些环境来自三个基准:Procgen、Deepmind Control 和 Pybullet,涵盖基于图像与向量的观测,以及离散与连续动作空间。我们观察到,相较于广义优势估计(Generalized Advantage Estimation, GAE)方法,我们的方法能更好地降低策略与价值损失,并最终提升累积回报。此外,我们的方法优于两种近期提出的数据增强技术(RAD 和 DRAC)。总体而言,在样本效率与泛化性上,我们的方法在经验上优于基线,其中智能体在未见环境中接受测试。

关键词

引用

@article{arxiv.2210.07312,
  title  = {Bootstrap Advantage Estimation for Policy Optimization in Reinforcement Learning},
  author = {Md Masudur Rahman and Yexiang Xue},
  journal= {arXiv preprint arXiv:2210.07312},
  year   = {2022}
}

备注

Accepted at IEEE ICMLA 2022