面向离线目标条件强化学习的潜在表征对齐
机器学习
2026-05-26 v1
摘要
离线目标条件强化学习(GCRL)提供了一种从固定数据集中获取目标到达策略的实用框架。然而,在长期orizon任务中学习可靠的目标条件价值函数仍然具有挑战性。本文识别了目标条件价值函数中存在的错误泛化为 fundamental 瓶颈,证明了在价值函数中引入适当的归纳偏置对于解决该瓶颈至关重要。基于这些发现,我们提出了潜在对齐价值学习(LAVL)一种集成潜在表征基于价值泛化与层次规划的离线GCRL算法。对OGBench上的大量实验表明,LAVL consistently优于现有的离线GCRL方法,在20个中的22个数据集上实现最高性能。值得注意的是,LAVL在长期orizon任务和轨迹拼接数据集上表现突出,而先前方法在这些场景中会出现显著的性能下降。我们的代码可在 https://github.com/oh-lab/LAVL.git 获取。
引用
@article{arxiv.2605.25740,
title = {Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning},
author = {Hyungkyu Kang and Byeongchan Kim and Min-hwan Oh},
journal= {arXiv preprint arXiv:2605.25740},
year = {2026}
}
备注
Accepted in ICML 2026