Muesli:策略优化中多种改进的融合
机器学习
2022-04-01 v2 人工智能
摘要
我们提出了一种新颖的策略更新方法,将正则化策略优化与作为辅助损失的模型学习相结合。该更新(下文称 Muesli)在 Atari 上达到了与 MuZero 相当的最先进性能。值得注意的是,Muesli 无需使用深度搜索:它直接由策略网络行动,且计算速度与无模型基线相当。Atari 结果辅以大量消融实验,以及连续控制与 9x9 围棋上的额外结果。
引用
@article{arxiv.2104.06159,
title = {Muesli: Combining Improvements in Policy Optimization},
author = {Matteo Hessel and Ivo Danihelka and Fabio Viola and Arthur Guez and Simon Schmitt and Laurent Sifre and Theophane Weber and David Silver and Hado van Hasselt},
journal= {arXiv preprint arXiv:2104.06159},
year = {2022}
}