循序渐进:多步元梯度强化学习的优劣
机器学习
2021-11-02 v1 人工智能
摘要
能够在线调整学习过程的自调优算法有助于更有效且鲁棒的学习。在所有可用方法中,元梯度已成为一种有前景的途径。它们利用学习规则相对于某些超参数的可微性,以在线方式调整这些超参数。尽管元梯度可在多个学习步上累积以避免短视更新,但这在实践中很少使用。本工作中,我们证明虽然多步元梯度在期望上提供了更好的学习信号,但其代价是方差显著增加,从而阻碍性能。鉴于此分析,我们引入一种混合多个内部步的新方法,其享有更准确且鲁棒的元梯度信号,本质上是在元梯度估计中权衡偏差与方差。当应用于贪吃蛇游戏时,该混合元梯度算法能将方差降低至 1/3,同时取得相似或更高的性能。
引用
@article{arxiv.2111.00206,
title = {One Step at a Time: Pros and Cons of Multi-Step Meta-Gradient Reinforcement Learning},
author = {Clément Bonnet and Paul Caron and Thomas Barrett and Ian Davies and Alexandre Laterre},
journal= {arXiv preprint arXiv:2111.00206},
year = {2021}
}
备注
14 pages, 6 figures, 2 tables