将正则化与动作空间解耦
机器学习
2025-01-10 v1
摘要
正则化强化学习(RL),特别是熵正则化类型,在最优控制和逆强化学习中已获得关注。虽然标准的无正则化RL方法不受动作数量变化的影响,但我们表明这可能会严重影响其正则化对应方法。本文论证了将正则化器与动作空间解耦的重要性:即无论涉及多少动作,都要保持一致的正则化水平,以避免过度正则化。虽然可以通过引入特定任务的温度参数来避免该问题,但这通常不可取,并且在动作空间是状态依赖的情况下无法解决问题。在状态依赖动作的背景下,具有不同动作空间的不同状态被不一致地正则化。我们引入了两种解决方案:一种静态温度选择方法和一种动态对应方法,它们普遍适用于出现此问题的场景。在静态和动态温度机制下的DeepMind控制套件以及一项生物序列设计任务中,实施这些更改提高了性能。
引用
@article{arxiv.2406.05953,
title = {Decoupling regularization from the action space},
author = {Sobhan Mohammadpour and Emma Frejinger and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:2406.05953},
year = {2025}
}