函数空间中的目标网络学习
机器学习
2024-09-24 v2 人工智能
摘要
我们聚焦于强化学习 (RL) 设置下学习价值函数的任务。这一任务通常通过更新一对在线网络和目标网络来实现,确保这两个网络的参数等效。我们提出 Lookahead-Replicate (LR),一种新的价值函数近似算法,针对这种参数空间等效性保持问题持中立态度。相反,LR 算法旨在在函数空间保持两个网络的等效性。通过采用新的目标网络更新方法,获得这种基于函数的等效性。我们证明,LR 能实现价值函数学习的收敛行为。我们还展示了经验结果,表明基于 LR 的目标网络更新显著改进了在 Atari 基准测试上的深度强化学习。
引用
@article{arxiv.2406.01838,
title = {Learning the Target Network in Function Space},
author = {Kavosh Asadi and Yao Liu and Shoham Sabach and Ming Yin and Rasool Fakoor},
journal= {arXiv preprint arXiv:2406.01838},
year = {2024}
}
备注
Accepted to International Conference on Machine Learning (ICML24)