中文

具有分布内在线适应的离线元强化学习

机器学习 2023-06-02 v2 人工智能

摘要

近期离线元强化学习(meta-RL)方法通常利用任务相关的行为策略(例如,在每个单独任务上训练 RL 智能体)来收集多任务数据集。然而,这些方法总是需要额外信息以实现快速适应,例如用于测试任务的离线上下文。为解决这个问题,我们首先形式化刻画了离线元强化学习中的一个独特挑战:离线数据集与在线适应之间的转移-奖励分布偏移。我们的理论发现,分布外适应片段可能导致不可靠的策略评估,而使用分布内片段的在线适应可确保适应性能保证。基于这些理论见解,我们提出了一种称为带不确定性量化的分布内在线适应(IDAQ)的新颖适应框架,其利用给定的不确定性量化生成分布内上下文,并执行有效的任务信念推断以应对新任务。我们为 IDAQ 找到了一种基于回报的不确定性量化方法,表现有效。实验表明,在 Meta-World ML1 基准上,IDAQ 相较于带/不带离线适应的基线均取得了最先进的性能。

关键词

引用

@article{arxiv.2305.19529,
  title  = {Offline Meta Reinforcement Learning with In-Distribution Online Adaptation},
  author = {Jianhao Wang and Jin Zhang and Haozhe Jiang and Junyu Zhang and Liwei Wang and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2305.19529},
  year   = {2023}
}