中文

具特权信息的可证明部分可观测强化学习

机器学习 2025-02-24 v3

摘要

部分可观测的底层状态通常为强化学习 (RL) 带来显著挑战。在实际应用中,已利用某些 \emph{特权信息}, 例如访问模拟器中的状态, 在训练中取得了显著的经验成功。为更好地理解特权信息的益处, 本文重新审视并检查了本 setting 下几种简单且实用的方法范式。具体而言, 我们首先形式化了 \emph{专家蒸馏} (也称为 \emph{教师-学生} 学习) 的经验范式, 并展示了其在寻找近最优策略方面的缺陷。随后, 我们识别了部分可观测环境的一个条件, 即 \emph{确定性滤波条件}, 在该条件下, 专家蒸馏实现样本和计算复杂度的 \emph{同时} 多项式。进一步, 我们研究了另一种有用的经验范式 \emph{非对称 actor-critic}, 并聚焦于更具挑战性的可观测部分可观测马尔可夫决策过程的 setting。我们开发了一种信念加权非对称 actor-critic 算法, 在其中 one key component 是一种新的可证明的 oracle 用于学习信念状态, 该信念状态在模型误指定下保持 \emph{滤波稳定性}, 这可能是独立感兴趣的。最后, 我们也研究了具特权信息的部分可观测多智能体强化学习 (MARL) 的可证明效率。我们开发了具有 \emph{集中训练-分布执行} 的算法, 这一方法是经验 MARL 中流行的框架, 在上述两种范式中都具有多项式样本和 (准) 多项式计算复杂度。与最近几项相关理论研究相比, 我们关注的是理解实用启发的算法范式, 而不涉及计算不可解或 oracle。

关键词

引用

@article{arxiv.2412.00985,
  title  = {Provable Partially Observable Reinforcement Learning with Privileged Information},
  author = {Yang Cai and Xiangyu Liu and Argyris Oikonomou and Kaiqing Zhang},
  journal= {arXiv preprint arXiv:2412.00985},
  year   = {2025}
}

备注

This paper has been accepted to 2024 Conference on Neural Information Processing Systems (NeurIPS 2024)