悲观主义原理可以有效:迈向零样本迁移强化学习框架
机器学习
2025-05-30 v2
摘要
迁移强化学习旨在通过利用相关源域中的丰富数据,为目标环境推导出接近最优的策略,且数据有限。然而,它面临两个关键挑战:迁移策略缺乏性能保证,可能导致不理想的动作,以及涉及多个源域时负迁移的风险。我们提出了一种基于悲观主义原理的新型框架,该框架构建并优化目标域性能的保守估计。我们的框架通过提供目标性能的最优下界,有效解决了这两个挑战,确保安全可靠的决策,并通过随源域质量的单调提升来避免负迁移。我们构建了两种类型的保守估计,严格刻画了其有效性,并开发了具有收敛保证的高效分布式算法。我们的框架为强化学习中的迁移学习提供了一个理论上严谨且实践上鲁棒的解决方案。
引用
@article{arxiv.2505.18447,
title = {Pessimism Principle Can Be Effective: Towards a Framework for Zero-Shot Transfer Reinforcement Learning},
author = {Chi Zhang and Ziying Jia and George K. Atia and Sihong He and Yue Wang},
journal= {arXiv preprint arXiv:2505.18447},
year = {2025}
}
备注
Accepted to ICML 2025