中文

基于域未标注数据的离线强化学习

机器学习 2025-03-04 v2

摘要

离线强化学习在主动数据收集成本高昂或不可行的领域(如机器人技术或医疗保健)中至关重要。在现实世界中,离线数据集通常涉及多个域,这些域共享相同的状态和动作空间,但具有不同的动力学特性,并且只有一小部分样本被明确标记为属于我们感兴趣的目标域。例如,在机器人技术中,精确的系统辨识可能仅对部分部署场景执行。为应对这一挑战,我们考虑了正-未标注离线强化学习(PUORL),这是一种新颖的离线强化学习设置,其中我们拥有少量标记的目标域数据和大量来自多个域(包括目标域)的域未标注数据。对于PUORL,我们提出了一种即插即用的方法,利用正-未标注(PU)学习来训练一个域分类器。然后,该分类器从域未标注数据中提取目标域样本,从而扩充稀缺的目标域数据。在修改版D4RL基准上的实验结果表明了我们方法的有效性:即使数据集中只有1%到3%的样本被域标记,我们的方法也能准确识别目标域样本,并在动力学特性发生显著变化的情况下实现高性能。我们的即插即用算法将PU学习无缝集成到现有的离线强化学习流程中,从而在全面域标记不可行的场景中实现有效的多域数据利用。

关键词

引用

@article{arxiv.2404.07465,
  title  = {Offline Reinforcement Learning with Domain-Unlabeled Data},
  author = {Soichiro Nishimori and Xin-Qiang Cai and Johannes Ackermann and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2404.07465},
  year   = {2025}
}