随机演员-评论家:通过时序阿尔法塔不确定性缓解超估计问题
机器学习
2026-01-05 v1 人工智能
系统与控制
系统与控制
摘要
强化学习中的离策略演员-评论家方法通过时序差分更新训练评论家,并用作策略(演员)的学习信号。此设计通常比纯粹的在策略方法更具样本效率。然而,评论家网络会系统性地高估价值估计。这通常通过引入基于不确定性估计的悲观偏差来解决。当前方法利用集成来量化评论家的识感不确定性——由于有限数据和模型模糊性导致的不确定性——以规模化悲观更新。在本工作中,我们提出了一种名为随机演员-评论家(STAC)的新算法,其包含时序(单步)阿尔法塔不确定性——源自随机转换、奖励和策略引起的Bellman目标不确定性——以规模化时序差分更新中的悲观偏差,而不是依赖于识感不确定性。STAC使用单个分布式评论家网络来建模时序回报不确定性,并对评论家和演员网络应用dropout进行正则化。我们的结果表明,仅凭分布式评论家就足以缓解超估计问题,并自然导致随机环境中的风险厌恶行为。通过引入dropout进一步提高了训练稳定性和性能。凭借这种设计,STAC使用单个分布式评论家网络实现了更好的计算效率。
关键词
引用
@article{arxiv.2601.00737,
title = {Stochastic Actor-Critic: Mitigating Overestimation via Temporal Aleatoric Uncertainty},
author = {Uğurcan Özalp},
journal= {arXiv preprint arXiv:2601.00737},
year = {2026}
}
备注
19 pages