增长批次强化学习中从教师到学习者的知识迁移
机器学习
2023-05-11 v2
摘要
标准的序贯决策方法利用智能体持续与环境交互并改进其控制策略的能力。然而,由于安全性、伦理性和实用性约束,这类试错实验在医疗和机器人等许多现实领域往往不可行。相反,这些领域的控制策略通常从先前记录的数据离线训练,或以增长批次方式训练。在此设定中,一个固定策略被部署到环境中,用于在聚合过往批次并更新策略之前收集整批新数据。该改进循环可重复多次。尽管现实领域中有限次数的此类循环是可行的,所得数据的质量与多样性远低于标准持续交互方法。然而,这些领域的数据收集常与人类专家协同进行,专家能够对所收集数据进行标注或注释。本文中,我们首先探讨该增长批次设定中的权衡,进而研究在训练时如何利用教师提供的信息(即演示、专家动作与梯度信息)来缓解 actor-critic 方法的样本复杂性与覆盖要求。我们在DeepMind Control Suite的任务上验证了我们的贡献。
引用
@article{arxiv.2305.03870,
title = {Knowledge Transfer from Teachers to Learners in Growing-Batch Reinforcement Learning},
author = {Patrick Emedom-Nnamdi and Abram L. Friesen and Bobak Shahriari and Nando de Freitas and Matt W. Hoffman},
journal= {arXiv preprint arXiv:2305.03870},
year = {2023}
}
备注
Reincarnating Reinforcement Learning Workshop at ICLR 2023