离散动作空间的软演员-评论家算法推广
机器学习
2024-07-17 v1 人工智能
摘要
ATARI 是由强化学习 (RL) 研究人员用于测试学习算法有效性的视频游戏套件。代理人仅接收原始像素和游戏得分,便能学习出发展出相当于专业人类游戏测试员水平的复杂策略。理想情况下,我们希望代理人只需与环境进行极少的交互。先前针对该任务的竞争性无模型算法使用基于价值的 Rainbow algorithm,且不包含任何策略头。在本文中,我们通过提出一种针对离散动作空间的实用 soft actor-critic (SAC) 算法变体来实现这一目标。该新变体使离散领域能够使用策略头进行 off-policy 学习。通过将其整合到先进的 Rainbow 变体,即 "更大、更好、更快" (BBF),得到的 SAC-BBF 将 IQM 从 1.045 提升至 1.088,且仅使用回放比率 (RR) 2 即可实现。通过使用更低的 RR 2,SAC-BBF 的训练时间仅为使用 RR 8 时 BBF 实现 IQM 为 1.045 所需时间的三分之一。IQM 大于 1 表示超人类表现,SAC-BBF 也是唯一仅使用 RR 2 的无模型算法中实现超人类水平的算法。代码已在 GitHub 上公开,地址为 https://github.com/lezhang-thu/bigger-better-faster-SAC。
引用
@article{arxiv.2407.11044,
title = {Generalizing soft actor-critic algorithms to discrete action spaces},
author = {Le Zhang and Yong Gu and Xin Zhao and Yanshuo Zhang and Shu Zhao and Yifei Jin and Xinxin Wu},
journal= {arXiv preprint arXiv:2407.11044},
year = {2024}
}
备注
Chinese Conference on Pattern Recognition and Computer Vision (PRCV) 2024. GitHub Repo https://github.com/lezhang-thu/bigger-better-faster-SAC