中文

面向离线目标条件强化学习的选项感时空抽象价值

机器学习 2025-11-05 v2 人工智能

摘要

离线目标条件强化学习 (GCRL) 提供了一种在无需额外环境交互的情况下,从丰富的状态-动作轨迹数据集中训练目标到达策略的实用学习范式。然而,离线 GCRL 仍在处理长期程任务时困难重重,即便是近期采用层次化策略结构如 HIQL 的进展。我们识别了这一挑战的根本原因,观察到以下见解:首先,性能瓶颈主要源于高层次策略生成恰当子目标的能力不足。其次,在长期程学习高层次策略时,优势估计的符号经常变为错误。因此,我们认为改进价值函数以为高层次策略的学习产生清晰的优势估计至关重要。本文提出了一个简单而有效的解决方案:选项感时空抽象价值学习,称为 OTA,融入时空抽象化到时序差分学习过程中。通过修改价值更新以实现选项感知,本方法缩短了有效时程长度,即使在长期程情境下也能获得更好的优势估计。我们在实验中表明,使用 OTA 价值函数学习的高层次策略在 OGBench 上由复杂任务中取得优异性能,包括迷宫导航和视觉机器人操控环境。

关键词

引用

@article{arxiv.2505.12737,
  title  = {Option-aware Temporally Abstracted Value for Offline Goal-Conditioned Reinforcement Learning},
  author = {Hongjoon Ahn and Heewoong Choi and Jisu Han and Taesup Moon},
  journal= {arXiv preprint arXiv:2505.12737},
  year   = {2025}
}