一步贝尔曼对齐在在线强化学习中实现可证明的高效迁移
机器学习
2026-05-26 v2 机器学习
摘要
我们研究了在随机决策过程中的在线迁移强化学习,其中在学习目标任务期间可获得来自相关源任务的经验。一个根本性难题是:任务相似性通常以奖励或转移的形式定义,而在线强化学习算法则作用于贝尔曼回归目标上。因此,直接重用源贝尔曼更新会引入系统性偏差,从而使后悔保证失效。我们识别出在线强化学习中迁移的正确抽象是一步贝尔曼对齐,并提出了重新加权定向(RWT),这是一种在算子层面的纠正方法,通过改变度量来重新定向延续值并补偿转移不匹配。RWT将任务不匹配降低为一个固定的一步纠正,并使源数据的统计学上可重用成为可能。这种对齐导致了一个两阶段RWTQ学习框架,将方差缩减与偏差纠正分离。在RKHS函数逼近下,我们建立的后悔界随任务偏移的复杂度而非目标MDP的复杂度而增长。我们进一步展示,所需的密度比率可通过具有有限样本保证的构造RKHS估计器实现,并经验验证其对估计和误指定比率的鲁棒性。在表格和神经网络设置下的经验结果表明,与单任务学习和简单池化相比, Bellman对齐在在线强化学习中实现持续的改进,这一点突显了Bellman对齐是一种面向在线强化学习的模型无关迁移原则。
引用
@article{arxiv.2601.21924,
title = {One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL},
author = {Elynn Chen and Enpei Zhang and Jinhang Chai and Yujun Yan},
journal= {arXiv preprint arXiv:2601.21924},
year = {2026}
}