中文

SARC:软 actor 回顾评论家

机器学习 2023-06-30 v1 人工智能

摘要

SAC 作为一种 actor-critic 算法,其双时间尺度特性表现为:在任意给定时刻,评论家估计对 actor 尚未收敛,但由于评论家学习快于 actor,它保证了二者最终的的一致性。文献中已引入多种策略以学习更好的梯度估计,从而帮助实现更好的收敛。由于梯度估计依赖于评论家,我们假定改进评论家可在每一时刻为 actor 提供更好的梯度估计。基于此,我们提出软 actor 回顾评论家(SARC),其中我们用另一损失项——回顾损失——扩充 SAC 评论家损失,从而导致更快的评论家收敛,并进而为 actor 提供更好的策略梯度估计。现有的 SAC 实现只需极少修改即可轻松适配 SARC。通过广泛的实验与分析,我们表明 SARC 在基准环境上相对 SAC 提供了一致的改进。我们计划在 https://github.com/sukritiverma1996/SARC 开源代码与所有实验数据。

关键词

引用

@article{arxiv.2306.16503,
  title  = {SARC: Soft Actor Retrospective Critic},
  author = {Sukriti Verma and Ayush Chopra and Jayakumar Subramanian and Mausoom Sarkar and Nikaash Puri and Piyush Gupta and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2306.16503},
  year   = {2023}
}

备注

Accepted at RLDM 2022