离线强化学习中的可证明零样本泛化
机器学习
2025-03-12 v1 人工智能
摘要
在本工作中,我们研究具有零样本泛化(ZSG)性质的离线强化学习(RL),其中智能体可以访问包含来自不同环境经验的离线数据集,其目标是在训练环境上训练策略,且无需进一步交互即可在测试环境中表现良好。现有工作表明,经典离线 RL 无法泛化到新的、未见过的环境。我们提出了悲观经验风险最小化(PERM)和悲观近端策略优化(PPPO),它们利用悲观策略评估来指导策略学习并增强泛化能力。我们表明 PERM 和 PPPO 都能够找到具有 ZSG 的近最优策略。我们的结果作为理解离线强化学习中泛化现象基础的第一步。
引用
@article{arxiv.2503.07988,
title = {Provable Zero-Shot Generalization in Offline Reinforcement Learning},
author = {Zhiyong Wang and Chen Yang and John C. S. Lui and Dongruo Zhou},
journal= {arXiv preprint arXiv:2503.07988},
year = {2025}
}
备注
30 pages, 1 figure, 1 table