面向流式强化学习的有意图更新
机器学习
2026-04-22 v1 人工智能
摘要
在梯度学习中,参数单位选择的步长不会产生可预测的函数输出变化。这常导致在流式设置中(即 batch size=1)出现不稳定现象,因为随机性没有被平均出来,更新幅度可能会暂时变得任意大或小。相反,我们提出了有意图更新:首先指定更新意图的结果,然后求解实现该结果的步长。这种策略在基于在线监督线性回归的 Normalized Least Mean Squares 算法中已有 precedent,即该算法选择步长以产生与当前 error 成比例的函数输出固定比例变化。我们将这一原则扩展到流式深度强化学习中,通过定义 appropriate 意图结果:Intentional TD 旨在实现 TD error 的固定比例减少,Intentional Policy Gradient 旨在限制策略的 per-step 变化,限制 local KL 散度。我们提出了结合 eligibility traces 和对角线 scaling 的实用算法。经验上,这些方法产生了流式的最先进性能,经常在与 batch 和 replay-buffer 方法相当的表现上。
引用
@article{arxiv.2604.19033,
title = {Intentional Updates for Streaming Reinforcement Learning},
author = {Arsalan Sharifnassab and Mohamed Elsayed and Kris De Asis and A. Rupam Mahmood and Richard S. Sutton},
journal= {arXiv preprint arXiv:2604.19033},
year = {2026}
}