具有函数逼近与理论保证的决策感知 actor-critic 方法
机器学习
2023-11-01 v2 人工智能
最优化与控制
摘要
Actor-critic (AC)方法在强化学习(RL)中被广泛使用,并受益于可使用任意策略梯度方法作为actor、基于值的方法作为critic的灵活性。Critic通常通过最小化TD误差来训练,该目标可能与actor获得高奖励的真实目标去相关。我们通过以决策感知的方式设计训练actor与critic的联合目标来解决这种失配。我们利用所提出的目标设计了一种通用的AC算法,可轻松处理任意函数逼近。我们明确刻画了所得算法保证单调策略改进的条件,而与策略和critic参数化的选择无关。实例化该通用算法得到一个涉及最大化一系列替代函数(类似于TRPO、PPO)的actor,以及一个涉及最小化紧密关联目标的critic。利用简单bandit示例,我们可证明所提critic目标相对于标准平方误差的优势。最后,我们在简单RL问题上实证展示了决策感知actor-critic框架的益处。
引用
@article{arxiv.2305.15249,
title = {Decision-Aware Actor-Critic with Function Approximation and Theoretical Guarantees},
author = {Sharan Vaswani and Amirreza Kazemi and Reza Babanezhad and Nicolas Le Roux},
journal= {arXiv preprint arXiv:2305.15249},
year = {2023}
}
备注
NeurIPS 2023