SVL:基于生存学习的目标导向强化学习
机器学习
2026-04-21 v1 人工智能
摘要
标准的目标导向强化学习(GCRL)方法由于基于时序差学习,往往不稳定且样本效率低。虽然近期研究探索了对比和监督形式以提高稳定性,但我们提出了另一种概率方法——生存价值学习(SVL),将GCRL重新表述为生存学习问题,通过对每个状态到目标的时间进行概率分布建模。这种结构化的蒙特卡洛视角产生了一个闭式恒等式,将目标导向价值函数表达为生存概率的折扣求和,使价值估计可以通过在事件和右删失轨迹上通过最大似然法训练的危害模型实现。我们引入了三个实用价值估计器,包括有限时域截断和两种对数无限时域近似,以捕捉长期目标。实验在离线GCRL基准上表明,SVL结合层次化行为在匹配或超越强大的层次化TD和蒙特卡洛基线方面表现优异,尤其在复杂的长期任务中表现突出。
引用
@article{arxiv.2604.17551,
title = {SVL: Goal-Conditioned Reinforcement Learning as Survival Learning},
author = {Franki Nguimatsia Tiofack and Fabian Schramm and Théotime Le Hellard and Justin Carpentier},
journal= {arXiv preprint arXiv:2604.17551},
year = {2026}
}