熵增广强化学习
机器学习
2023-03-06 v2
摘要
深度强化学习在信赖域方法出现后得以兴起,其具备可扩展性与高效性。然而,此类算法的悲观性(其中它迫使无论如何都要约束于信赖域内)已被证明会抑制探索并损害性能。诸如 SAC 等探索性算法虽利用熵鼓励探索,却隐式地优化了另一目标。我们首先观察到这一不一致性,进而提出一种类似的增广技术,当涉及值 critic 时,其与 on-policy 算法良好结合。令人惊讶的是,所提方法一致满足软策略改进定理,同时更具可扩展性。如分析所示,控制温度系数以平衡探索与利用至关重要。在 MuJoCo 基准任务上的实证测试表明,智能体被激励朝向更高奖励区域,并享有更优性能。此外,我们在一组定制环境中验证了本方法的探索奖励。
引用
@article{arxiv.2208.09322,
title = {Entropy Augmented Reinforcement Learning},
author = {Jianfei Ma},
journal= {arXiv preprint arXiv:2208.09322},
year = {2023}
}