蒸馏还是决策?理解部分可观测强化学习中的算法权衡
机器学习
2025-10-06 v1
摘要
部分可观测性是强化学习(RL)中一个臭名昭著的挑战,因为需要学习复杂的、依赖历史状态的策略。近期经验上的成功利用了特权专家蒸馏——即在训练期间利用潜在状态信息(例如来自模拟器)来学习并模仿最优的潜在马尔可夫策略——从而将“学习观察”与“学习行动”的任务解耦。尽管专家蒸馏比没有潜在状态信息的 RL 计算效率更高,但它也有记录在案的失败模式。在本文中,通过一个名为扰动 Block MDP 的简单但具指导意义的理论模型,以及在具有挑战性的模拟运动任务上的对照实验,我们研究了特权专家蒸馏与无特权信息的标准 RL 之间的算法权衡。我们的主要发现是:(1)该权衡在经验上取决于潜在动态的随机性,这一点在理论上通过对比扰动 Block MDP 中的近似可解码性与信念收缩得到了预测;(2)最优的潜在策略并不总是用于蒸馏的最佳潜在策略。我们的结果为有效利用特权信息提供了新指导,有望提升许多实际部分可观测领域中策略学习的效率。
引用
@article{arxiv.2510.03207,
title = {To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning},
author = {Yuda Song and Dhruv Rohatgi and Aarti Singh and J. Andrew Bagnell},
journal= {arXiv preprint arXiv:2510.03207},
year = {2025}
}
备注
45 pages, 9 figures, published at NeurIPS 2025