从多个黑盒预言机进行主动策略改进
机器学习
2025-08-12 v3 人工智能
机器学习
摘要
强化学习(RL)已在多个复杂领域取得显著进展。然而,通过 RL 找到有效策略往往需要进行大量探索。模仿学习旨在利用专家示范来引导探索以缓解此问题。在真实场景中,人们通常能获得多个次优的黑盒专家,而非单一最优预言机。这些专家并非在所有状态下都相互占优,这给主动决定在何种状态下使用哪个预言机带来了挑战。我们提出 MAPS 和 MAPS-SE,一类从多个次优预言机进行模仿学习的策略改进算法。特别地,MAPS 主动选择模仿哪些预言机并改进其价值函数估计,MAPS-SE 还额外利用主动状态探索准则来决定应探索哪些状态。我们提供了全面的理论分析,并证明 MAPS 和 MAPS-SE 相比最先进的策略改进算法具有样本效率优势。实证结果表明,在 DeepMind Control Suite 的广泛控制任务中,MAPS-SE 通过基于状态的从多预言机模仿学习显著加速了策略优化。我们的代码公开于:https://github.com/ripl/maps。
引用
@article{arxiv.2306.10259,
title = {Active Policy Improvement from Multiple Black-box Oracles},
author = {Xuefeng Liu and Takuma Yoneda and Chaoqi Wang and Matthew R. Walter and Yuxin Chen},
journal= {arXiv preprint arXiv:2306.10259},
year = {2025}
}