中文

具有函数逼近与理论保证的决策感知 actor-critic 方法

机器学习 2023-11-01 v2 人工智能 最优化与控制

摘要

Actor-critic (AC)方法在强化学习(RL)中被广泛使用,并受益于可使用任意策略梯度方法作为actor、基于值的方法作为critic的灵活性。Critic通常通过最小化TD误差来训练,该目标可能与actor获得高奖励的真实目标去相关。我们通过以决策感知的方式设计训练actor与critic的联合目标来解决这种失配。我们利用所提出的目标设计了一种通用的AC算法,可轻松处理任意函数逼近。我们明确刻画了所得算法保证单调策略改进的条件,而与策略和critic参数化的选择无关。实例化该通用算法得到一个涉及最大化一系列替代函数(类似于TRPO、PPO)的actor,以及一个涉及最小化紧密关联目标的critic。利用简单bandit示例,我们可证明所提critic目标相对于标准平方误差的优势。最后,我们在简单RL问题上实证展示了决策感知actor-critic框架的益处。

关键词

引用

@article{arxiv.2305.15249,
  title  = {Decision-Aware Actor-Critic with Function Approximation and Theoretical Guarantees},
  author = {Sharan Vaswani and Amirreza Kazemi and Reza Babanezhad and Nicolas Le Roux},
  journal= {arXiv preprint arXiv:2305.15249},
  year   = {2023}
}

备注

NeurIPS 2023