强化学习智能体的条件数及其策略正则化应用
机器学习
2020-07-15 v2 机器学习
摘要
Jacobian 奇异值正则化在监督学习问题中的结果已被研究。也有工作表明 Jacobian 条件数正则化可帮助避免生成对抗网络(GAN)中的“模式崩溃”问题。在本文中,我们试图回答以下问题:关于策略条件数的信息是否有助于塑造更稳定和更具泛化性的强化学习智能体策略?为回答该问题,我们对策略优化过程中的 Jacobian 条件数行为进行了研究。据我们所知,这是首个研究强化学习智能体条件数的工作。我们提出了一种条件数正则化算法,并在一系列连续控制任务上测试了其性能。最后,我们在具有分离训练与测试关卡的 CoinRun 环境中比较各算法,以分析条件数正则化如何促进智能体的泛化。
引用
@article{arxiv.1906.05437,
title = {Conditioning of Reinforcement Learning Agents and its Policy Regularization Application},
author = {Arip Asadulaev and Igor Kuznetsov and Gideon Stein and Andrey Filchenkov},
journal= {arXiv preprint arXiv:1906.05437},
year = {2020}
}