逐一而后:变化世界中的增量技能学习
机器学习
2022-03-22 v1 人工智能
机器人学
摘要
在无奖励、无监督的技能发现是任务监督稀缺或昂贵环境中手工设计奖励瓶颈的一种有吸引力替代方案。然而,当前技能预训练方法如同许多 RL 技术一样,做了一个基本假设——训练期间环境是平稳的。传统方法同时学习所有技能,这使得它们既难以快速适应环境变化,又难以在适应后不遗忘早期技能。另一方面,在演化或扩展的环境中,技能学习必须能够快速度适应新环境状况,同时不遗忘先前学习的技能。这两个条件使得经典技能发现在演化环境中难以表现良好。在这项工作中,我们提出了一种新的技能发现框架,其中技能以增量方式逐一学习。该框架允许新学习的技能适应新环境或智能体动力学,而固定的旧技能确保智能体不遗忘已学技能。我们通过实验证明,在演化和静态环境中,增量技能在技能质量和解决下游任务能力上都显著优于当前最先进的技能发现方法。所学技能的视频和代码已在 https://notmahi.github.io/disk 公开。
引用
@article{arxiv.2203.11176,
title = {One After Another: Learning Incremental Skills for a Changing World},
author = {Nur Muhammad Shafiullah and Lerrel Pinto},
journal= {arXiv preprint arXiv:2203.11176},
year = {2022}
}
备注
To be published in The International Conference on Learning Representations (ICLR) 2022