保留支撑而非对应关系:面向离线强化学习的动态路由
机器学习
2026-04-27 v1 人工智能
摘要
单步离线强化学习演员因避免通过长迭代采样器进行反向传播,能够保持推理成本低廉,但仍需在批评家指导下改进,同时不脱离数据所能支撑的动作。在近期的单步提取管道中,强迭代教师为每个潜在抽样提供一个目标动作,学生输出被要求同时完成两个任务:向更高Q值靠拢并保持接近该配对终点。如果这两个方向不一致,损失会在该样本上进行妥协,即使存在更接近的数据支撑区域的更好动作。我们提出DROL(Dynamic Routing for Offline Reinforcement Learning),一种基于顶部1动态路由的潜在条件单步演员。对于每个状态,演员从受限潜在先验中抽取K个候选动作,为每个数据动作分配到最近的候选动作,并仅对该获胜者进行行为克隆和批评家指导。由于路由是从当前候选几何中重新计算的,支持区域的所有权可以在学习过程中围绕候选动作发生迁移。这为单步演员提供了在点提取难以捕捉的局部改进空间,同时保持测试时的单次推理。 在OGBench和D4RL上,DROL与单步FQL基线相当,在许多OGBench任务组上取得提升,同时在AntMaze和Adroit上表现稳健。项目页面:https://muzhancun.github.io/preprints/DROL。
引用
@article{arxiv.2604.22229,
title = {Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning},
author = {Zhancun Mu and Guangyu Zhao and Yiwu Zhong and Chi Zhang},
journal= {arXiv preprint arXiv:2604.22229},
year = {2026}
}
备注
17 pages, 4 figures