中文

面向可扩展目标条件强化学习的多步准度量学习

机器学习 2026-02-24 v3 机器人学

摘要

学习如何在环境中到达目标是 AI 中的一个长期存在的挑战,但对长时间范围的推理仍是现代方法的难题。关键问题是如何估计观察对之间的时间距离。虽然时间差方法利用局部更新提供最优性保证,但往往表现不如采用全局更新(例如多步返回)的蒙特卡洛方法,这些方法缺乏此类保证。我们展示了如何将这些方法集成到一种实用的离线 GCRL 方法中,通过多步蒙特卡洛返回拟合准度量距离。我们表明该方法在最高达4000步的长期程模拟任务中超越了现有的离线 GCRL 方法,即便仅使用视觉观察。我们还展示了该方法可以实现在桥梁 setup 中的真实世界机器人操作领域的拼接。我们的 approach 是首个实现端到端离线 GCRL 方法,使其能够从未标记的视觉观察离线数据集中实现多步拼接,并演示了稳健的 horizon 泛化。

关键词

引用

@article{arxiv.2511.07730,
  title  = {Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning},
  author = {Bill Chunyuan Zheng and Vivek Myers and Benjamin Eysenbach and Sergey Levine},
  journal= {arXiv preprint arXiv:2511.07730},
  year   = {2026}
}