面向离线元强化学习的上下文偏移消减方法
机器学习
2023-11-08 v1 人工智能
摘要
离线元强化学习(OMRL)利用预先收集的离线数据集来增强智能体在未见任务上的泛化能力。然而,由于训练所用上下文(来自行为策略)与测试所用上下文(来自探索策略)之间的分布差异,出现了上下文偏移问题。上下文偏移问题导致任务推断错误,并进一步损害元策略的泛化能力。现有 OMRL 方法要么忽视该问题,要么试图借助额外信息缓解它。本文提出一种称为面向 OMRL 的上下文偏移消减(CSRO)的新方法,仅使用离线数据集来解决上下文偏移问题。CSRO 的核心思想是在元训练与元测试阶段均最小化策略在上下文中的影响。在元训练期间,我们设计了一种最大-最小互信息表示学习机制,以减少行为策略对任务表示的影响。在元测试阶段,我们引入无先验上下文收集策略以降低探索策略的影响。实验结果表明,CSRO 显著减少了上下文偏移并提升了泛化能力,在各种具有挑战性的领域中均超越先前方法。
引用
@article{arxiv.2311.03695,
title = {Context Shift Reduction for Offline Meta-Reinforcement Learning},
author = {Yunkai Gao and Rui Zhang and Jiaming Guo and Fan Wu and Qi Yi and Shaohui Peng and Siming Lan and Ruizhi Chen and Zidong Du and Xing Hu and Qi Guo and Ling Li and Yunji Chen},
journal= {arXiv preprint arXiv:2311.03695},
year = {2023}
}