TLDR:基于时序距离感知表征的无监督目标条件强化学习
机器学习
2024-12-10 v2 人工智能
摘要
无监督目标条件强化学习(GCRL)是一种 developing diverse robotic skills without external supervision 的前景方法。然而,现有的无监督GCRL方法往往难以覆盖复杂环境中广泛的状态范围 due to limited exploration and sparse or noisy rewards for GCRL。为克服这些挑战,我们提出了一种新颖的无监督GCRL方法,利用时序距离感知表征(TLDR)。基于时序距离,TLDR选择远离的目标以 initiate exploration,并计算内在探索奖励和目标到达奖励。具体而言,我们的探索策略寻求具有大时序距离的状态(即覆盖大范围状态空间),而目标条件策略学习最小化到目标的时序距离(即到达目标)。我们的结果在六个模拟 locomotion 环境中表明,TLDR 在实现广泛状态方面显著优于先前的无监督GCRL方法。
引用
@article{arxiv.2407.08464,
title = {TLDR: Unsupervised Goal-Conditioned RL via Temporal Distance-Aware Representations},
author = {Junik Bae and Kwanyoung Park and Youngwoon Lee},
journal= {arXiv preprint arXiv:2407.08464},
year = {2024}
}
备注
CoRL 2024