HIQL:以隐状态为动作的离线目标条件强化学习
机器学习
2024-03-12 v4 人工智能
机器人学
摘要
无监督预训练近来已成为计算机视觉与自然语言处理的基石。在强化学习(RL)中,目标条件 RL 有望提供一种类似的自监督方法,以利用大量无标签(无奖励)数据。然而,构建能够从多样化离线数据直接学习的有效目标条件 RL 算法具有挑战性,因为难以准确估计遥远目标的确切价值函数。尽管如此,目标到达问题呈现出结构:到达远距离目标须先经过较近的子目标。该结构可能非常有用,因为评估邻近目标下动作的质量通常比更遥远目标更容易。基于这一思想,我们提出一种从离线数据进行目标条件 RL 的分层算法。利用一个无动作价值函数,我们学习两个策略以利用此结构:一个将状态视为动作并预测(潜表示的)子目标的高层策略,以及一个预测用于到达该子目标的低层策略。通过分析与教学示例,我们展示了这种分层分解如何使我们的方法对估计价值函数中的噪声具有鲁棒性。随后我们将方法应用于离线目标到达基准,表明我们的方法能够解决令先前方法受挫的长视野任务,可扩展至高维图像观测,并易于利用无动作数据。我们的代码见 https://seohong.me/projects/hiql/
引用
@article{arxiv.2307.11949,
title = {HIQL: Offline Goal-Conditioned RL with Latent States as Actions},
author = {Seohong Park and Dibya Ghosh and Benjamin Eysenbach and Sergey Levine},
journal= {arXiv preprint arXiv:2307.11949},
year = {2024}
}
备注
NeurIPS 2023