桥接目标无与基于目标的强化学习之间的性能差距
机器学习
2026-03-02 v3 人工智能
摘要
在深度强化学习中,使用目标网络是缓解半梯度方法脆弱性并稳定学习的流行方法。然而,目标网络 notoriously 需要额外的内存,并且与理想的无目标方法相比会延迟 Bellman 更新的传播。在本工作中,我们走出目标无与基于目标算法之间的二元选择之外。我们引入了一种新方法,采用在线网络最后一个线性层的副本作为目标网络,同时与更新的在线网络共享其余参数。这种简单的修改使我们能够保持目标无方法的低内存占用,同时利用目标方法文献。我们发现,将这种方法与迭代 学习的概念结合使用,即由学习连续 Bellman 更新的平行方式,有助于提高目标无方法的样本效率。我们提出的方法称为迭代共享 学习 (iS-QL),在各种问题上均能在单一 网络的情况下弥合目标无与目标有方法之间的性能差距,从而朝着资源高效的强化学习算法迈进。
引用
@article{arxiv.2506.04398,
title = {Bridging the Performance Gap Between Target-Free and Target-Based Reinforcement Learning},
author = {Théo Vincent and Yogesh Tripathi and Tim Faust and Abdullah Akgül and Yaniv Oren and Melih Kandemir and Jan Peters and Carlo D'Eramo},
journal= {arXiv preprint arXiv:2506.04398},
year = {2026}
}