面向目标对齐的强化学习
机器学习
2026-05-20 v2 人工智能
摘要
许多基于价值的深度强化学习算法依赖目标网络——在线网络的延迟副本——来稳定训练。虽然有效,但这种机制引入了一种根本的稳定性与新颖性之间的权衡:目标更新速度较慢会提高稳定性,但会降低学习信号的新颖性,阻碍收敛速度。我们提出了面向目标对齐的强化学习(Target-Aligned Reinforcement Learning, TARL),这是一种针对现有算法的简单替代方案,强调那些目标网络估计与在线网络估计高度对齐的转换。通过聚焦于已对齐目标上的更新,TARL 在保留目标网络稳定效应的同时,减轻了陈旧目标估计的不利影响。我们在无需任何超参数调优的情况下,通过离散和连续控制算法在各种基准环境中的实验,证明了 TARL 能够实现持续的改进,包括在 Atari-10 上的 38.18% 峰值得分提升,同时仅增加约 4% 的 wall-clock 时间。
引用
@article{arxiv.2603.29501,
title = {Target-Aligned Reinforcement Learning},
author = {Leonard S. Pleiss and James Harrison and Maximilian Schiffer},
journal= {arXiv preprint arXiv:2603.29501},
year = {2026}
}