知情非对称 Actor-Critic:利用全状态访问之外的特权信号
机器学习
2026-02-06 v2 机器学习
摘要
非对称 Actor-Critic 方法在部分可观测强化学习中被广泛使用,但通常假设在训练期间具有完全状态可观测性来作为 Critic 的条件,这在实践中往往是不切实际的。我们引入了知情非对称 Actor-Critic 框架,允许 Critic 以任意依赖于状态的特权信号为条件,而无需访问完整状态。我们证明,任何此类特权信号都能产生无偏的策略梯度估计,从而大幅扩展了可容许特权信息的集合。这引出了如何选择最合适的特权信息以改善学习的问题。为此,我们提出了两个新的信息量度量标准:一个可在训练前应用的基于依赖性的测试,以及一个可在事后应用的基于价值预测精度改善的度量标准。在部分可观测基准任务和合成环境中的实证结果表明,经过精心选择的特权信号能够匹配或超越全状态非对称基线,同时依赖的状态信息严格更少。
引用
@article{arxiv.2509.26000,
title = {Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access},
author = {Daniel Ebi and Gaspard Lambrechts and Damien Ernst and Klemens Böhm},
journal= {arXiv preprint arXiv:2509.26000},
year = {2026}
}
备注
11 pages, 26 pages total, 3 figures