用于高效深度强化学习的去相关软演员-评论家
机器学习
2025-02-03 v1 人工智能
摘要
在处理高维数据时,强化学习(RL)中信用分配的有效性受到深度神经网络表示学习成功程度的影响,这对深度 RL 算法的样本效率具有意义。输入去相关此前被引入作为加速神经网络优化的方法,已在高效深度学习以及作为深度 RL 算法有效表示学习方法方面证明具有影响。我们提出了一种基于去相关反向传播算法的在线去相关方法,无缝集成到 RL 训练管道中。为每个层添加去相关矩阵,这些矩阵使用独立的去相关学习规则更新,该规则最小化跨所有层的总去相关损失,同时也最小化常规 RL 损失。我们将该方法与软演员-评论家(SAC)方法结合使用,称为去相关软演员-评论家(DSAC)。在 Atari 100k 基准测试中使用 DSAC 显示,与常规 SAC 基线相比,在测试的五个游戏中训练更快,在两个游戏中实现 improved reward performance,同时将 wall-clock 时间约减少 50%,而在其他游戏上保持性能水平。这些结果表明网络范围内去相关对深度 RL 的样本效率通过更有效的信用分配产生了积极影响。
引用
@article{arxiv.2501.19133,
title = {Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning},
author = {Burcu Küçükoğlu and Sander Dalm and Marcel van Gerven},
journal= {arXiv preprint arXiv:2501.19133},
year = {2025}
}