中文

增强离线强化学习中的无标签数据

人工智能 2024-06-12 v1 机器学习

摘要

近期在离线强化学习(Offline RL)方面的进展,导致越来越多关注基于保守策略更新的方法,以解决分布外问题(OOD)。这些方法通常涉及添加行为正则化或修改 critic 学习目标,主要针对具有数据支持的状态或动作。然而,我们挑战这一主流观点,认为动作或状态从未出现在数据集中,不一定意味着其次优性。在本文中,我们提出了一种新方法来解决 OOD 问题。我们引入一个离线 RL 教师-学生框架,并配合策略相似度度量。该框架使学生策略不仅从离线 RL 数据集中获取信息,还从教师策略传输的知识中获得见解。教师策略是使用由状态-动作对组成的数据集训练的,该数据集可视为在不直接与环境交互的情况下获取的实用领域知识。我们认为,这些额外的知识是有效解决 OOD 挑战的关键。该研究代表了将教师-学生网络集成到演员-评论家框架中的重要进展,为探索离线 RL 中知识迁移的研究开辟了新的方向,有效地解决了 OOD 挑战。

关键词

引用

@article{arxiv.2406.07117,
  title  = {Augmenting Offline RL with Unlabeled Data},
  author = {Zhao Wang and Briti Gangopadhyay and Jia-Fong Yeh and Shingo Takamatsu},
  journal= {arXiv preprint arXiv:2406.07117},
  year   = {2024}
}