中文

目标条件强化学习的测试时间图搜索

机器学习 2026-05-26 v2

摘要

离线目标条件强化学习(GCRL)在处理长期限任务时常常困难重重,因价值估计中的误差会积累,导致政策不可靠。通常假设,在没有专业训练的情况下,有效的长期规划是不可行的。相反,我们的工作表明,现有的 GCRL 政策可以通过结合一种轻量级、无需训练的规划包装器即可完成长期限任务。我们发现,标准的目标条件价值函数编码了足以进行规划的局部一致几何结构。我们的做法是测试时间图搜索(TTGS),它在离线数据集上构建图,并采用自适应子目标选择策略。为了解决在最短路径搜索中不可靠的价值估计问题,我们提出了一种新颖机制,对长距离转换进行软惩罚。该方法造成的计算开销可忽略不计,不需要额外的监督或参数更新。在 OGBench 基准测试中,TTGS 在多个基本学习者和任务上的成功率显著提升,其中在一些具有挑战性的长期限 locomotion 任务上,一些成功率从接近零提升到 90\%以上,常常匹配或超越需要复杂辅助训练的方法。代码和视频可在 https://ktolnos.github.io/ttgs 查看。

关键词

引用

@article{arxiv.2510.07257,
  title  = {Test-Time Graph Search for Goal-Conditioned Reinforcement Learning},
  author = {Evgenii Opryshko and Junwei Quan and Claas Voelcker and Yilun Du and Igor Gilitschenski},
  journal= {arXiv preprint arXiv:2510.07257},
  year   = {2026}
}