中文

面向鲁棒基于模型的离线强化学习的域泛化

机器学习 2022-11-29 v1 人工智能 机器学习

摘要

现有的离线强化学习(RL)算法通常假设训练数据满足以下之一:1)由已知策略生成,或 2)完全未知来源。我们考虑多示范者离线 RL,这是一种中间情形:我们知道每个数据集由哪些示范者生成,但对示范者的底层策略不做任何假设。这是从多个人类操作员收集数据时最自然的设定,却仍未被探索。由于不同的示范者引发不同的数据分布,我们表明这可以自然地框定为域泛化问题,每个示范者对应一个不同的域。具体而言,我们提出基于域不变模型的离线 RL(DIMORL),其中我们将风险外推(REx)(Krueger 等人,2020)应用于动力学与奖励模型的学习过程。我们的结果表明,与汇集所有示范者数据的自然基线相比,使用 REx 训练的模型展现出改进的域泛化性能。我们观察到,所得模型在离线基于模型的 RL 设定中频繁促成更优策略的学习,能提升策略学习过程的稳定性,并可能实现更强的探索。

关键词

引用

@article{arxiv.2211.14827,
  title  = {Domain Generalization for Robust Model-Based Offline Reinforcement Learning},
  author = {Alan Clark and Shoaib Ahmed Siddiqui and Robert Kirk and Usman Anwar and Stephen Chung and David Krueger},
  journal= {arXiv preprint arXiv:2211.14827},
  year   = {2022}
}

备注

Accepted to the NeurIPS 2022 Workshops on Distribution Shifts and Offline Reinforcement Learning