中文

基于准度量表示的无接近学习目标条件强化学习

机器学习 2025-12-03 v2

摘要

目标条件强化学习 (GCRL) 常用的学习状态表示以提取目标到达策略。两种表示结构框架在 GCRL 算法中尤为有效:(1) 对比表示,在该框架中,方法学习“后继特征”,以对比目标实现为目标,执行对未来结果的推理;(2) 时间距离,将表示空间中的(准)度量距离与从状态到目标的传递时间相联系。我们提出的方法将这两种框架统一,利用准度量表示空间的结构(三角不等式)以及适当的额外约束来学习后继表示,从而实现最优的目标到达。与过往工作不同,我们的方法能够利用**准度量**距离参数化来学习**最优**的目标到达距离,即使在**次优**数据和**随机**环境中也能做到。这赋予我们两者并存的优势:我们保留了蒙特卡洛对比强化学习方法的稳定性和长期程度能力,同时获得准度量网络参数化的免费拼接能力。在现有的离线 GCRL 基准测试中,我们的方法在基于对比学习的方法难以处理的拼接任务上表现出色,在噪声较大的高维环境中则优于基于准度量网络的方法。

关键词

引用

@article{arxiv.2509.20478,
  title  = {Offline Goal-conditioned Reinforcement Learning with Quasimetric Representations},
  author = {Vivek Myers and Bill Chunyuan Zheng and Benjamin Eysenbach and Sergey Levine},
  journal= {arXiv preprint arXiv:2509.20478},
  year   = {2025}
}