CUDC:一种用于离线强化学习的具有自适应时间距离的好奇心驱动无监督数据收集方法
机器学习
2023-12-20 v1 人工智能
机器学习
摘要
离线强化学习(RL)旨在从预先收集的数据集中学习有效策略。大多数现有工作致力于开发复杂的学习算法,而对改进数据收集过程的关注较少。此外,扩展单任务设置并收集允许智能体执行多个下游任务的_task-agnostic_数据集甚至更具挑战性。在本文中,我们提出了一种好奇心驱动无监督数据收集(CUDC)方法,利用自适应时间距离扩展特征空间以进行_task-agnostic_数据收集,最终提高多任务离线 RL 的学习效率和能力。为实现这一目标,CUDC 估计从当前状态可达的 k 步未来状态的概率,并调整动力学模型应预测的未来步数。通过这种自适应可达性机制,特征表示得以多样化,智能体能够利用好奇心自主导航以收集更高质量的数据。实证表明,在 DeepMind 控制套件的各种下游离线 RL 任务中,CUDC 在效率和学习性能上均超越了现有的无监督方法。
引用
@article{arxiv.2312.12191,
title = {CUDC: A Curiosity-Driven Unsupervised Data Collection Method with Adaptive Temporal Distances for Offline Reinforcement Learning},
author = {Chenyu Sun and Hangwei Qian and Chunyan Miao},
journal= {arXiv preprint arXiv:2312.12191},
year = {2023}
}
备注
Accepted at AAAI-24