中文

基于低质量数据的零样本强化学习

机器学习 2024-10-31 v3 人工智能

摘要

零样本强化学习(RL)承诺在离线的、无奖励的预训练阶段后,为智能体提供在环境中执行任意任务的能力。利用后继测度与后继特征的方法在此设定下展现出强劲性能,但需要在预训练时访问大型异构数据集,而对多数实际问题无法奢求。本文探讨当在小型同质数据集上训练时零样本 RL 方法的性能退化,并受保守性(一种成熟的单任务离线 RL 算法特性)启发提出修正。我们在多种数据集、领域与任务上评估所提方案,表明保守零样本 RL 算法在低质量数据集上优于非保守对应方法,在高质量数据集上表现不差。有些令人意外的是,我们的方案也优于在训练时得以观测任务的基线。我们的代码可通过 https://enjeeneer.io/projects/zero-shot-rl/ 获取。

关键词

引用

@article{arxiv.2309.15178,
  title  = {Zero-Shot Reinforcement Learning from Low Quality Data},
  author = {Scott Jeen and Tom Bewley and Jonathan M. Cullen},
  journal= {arXiv preprint arXiv:2309.15178},
  year   = {2024}
}

备注

NeurIPS 2024