中文

可达性加权离线目标条件重采样

机器学习 2025-06-04 v1

摘要

离线目标条件强化学习(RL)依赖于固定数据集,其中许多潜在目标共享相同的状态和动作空间。然而,这些潜在目标并未在收集的轨迹中显式表示。为了学习可泛化的目标条件策略,通常使用诸如 Q-learning 等动态规划方法对目标和状态-动作对进行均匀采样。然而,均匀采样需要极其庞大的数据集才能覆盖所有可能的组合,并会产生许多不可达的状态-目标-动作对,从而降低策略性能。我们的关键见解是,采样应倾向于能够实现目标达成的转换。为此,我们提出了可达性加权采样(RWS)。RWS 使用一个通过正未标记(PU)学习在目标条件状态-动作值上训练的可达性分类器。该分类器将这些值映射为可达性分数,随后将其用作采样优先级。RWS 是一个即插即用模块,可与标准离线 RL 算法无缝集成。在六个复杂的模拟机器人操作任务(包括配备机械臂和灵巧手的任务)上的实验表明,RWS 显著提升了性能。在一个显著案例中,HandBlock-Z 任务上的性能相比基线提升了近 50%。这些结果表明了可达性加权采样的有效性。

关键词

引用

@article{arxiv.2506.02577,
  title  = {Reachability Weighted Offline Goal-conditioned Resampling},
  author = {Wenyan Yang and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2506.02577},
  year   = {2025}
}