面向离线强化学习具有可证明覆盖能力的模型生成
机器学习
2022-06-09 v3
摘要
基于模型的、具有动力学感知策略的离线优化为策略学习与分布外泛化提供了新视角,其中所学策略可适应训练阶段枚举的不同动力学。但由于离线设定的限制,所学模型无法很好地模拟真实动力学以支持可靠的分布外探索,这仍阻碍策略的良好泛化。为缩小差距,已有工作粗略地集成随机初始化模型以更好地近似真实动力学。然而,这种做法代价高且效率低,且无法保证所学模型对真实动力学的近似程度,我们在本文中称之为覆盖能力。我们主动以高效可控的方式生成具有可证明覆盖真实动力学能力的模型来解决该问题。为此,我们基于策略在动力学下的占用率设计了动态模型的距离度量,并提出一种生成模型以优化其对真实动力学的覆盖度的算法。我们对模型生成过程进行了理论分析,并证明我们的算法能提供增强的覆盖能力。作为下游任务,我们以较小或无需保守惩罚训练动力学感知策略,实验表明我们的算法在现有离线 RL 基准上优于先前离线方法。我们还发现,由我们的方法学到的策略具有更好的零样本迁移性能,意味着其更好的泛化能力。
引用
@article{arxiv.2206.00316,
title = {Model Generation with Provable Coverability for Offline Reinforcement Learning},
author = {Chengxing Jia and Hao Yin and Chenxiao Gao and Tian Xu and Lei Yuan and Zongzhang Zhang and Yang Yu},
journal= {arXiv preprint arXiv:2206.00316},
year = {2022}
}
备注
Released without the permission of all co-authors