深度强化学习中离屏 actor-critic 的相对重要性采样
机器学习
2025-08-19 v9 人工智能
机器学习
摘要
在强化学习(RL)中,与同策略学习相比,离策略学习表现出更大的不稳定性。目标策略()与行为策略(b)之间概率分布的差异是不稳定性的一个主要原因。高方差也源于分布失配。目标策略分布与行为策略分布之间的差异可使用重要性采样(IS)来减小。然而,重要性采样具有高方差,在序列场景中这一问题更为严重。我们提出了一种平滑形式的重要性采样,即相对重要性采样(RIS),它可缓解方差并稳定学习。为控制方差,我们调整 RIS 中平滑参数 的值。我们利用该策略在 RL 中开发了首个无模型的相对重要性采样离策略 actor-critic (RIS-off-PAC) 算法。我们的方法使用网络生成目标策略(actor),并基于行为策略样本通过值函数(critic)评估当前策略()。我们的算法在奖励函数中使用行为策略动作值而非目标策略动作值进行训练。actor 与 critic 均使用深度神经网络训练。我们的方法在 OpenAI Gym 挑战与合成数据集上的表现优于或等于若干当前最优 RL 基准。
引用
@article{arxiv.1810.12558,
title = {Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning},
author = {Mahammad Humayoo and Gengzhong Zheng and Xiaoqing Dong and Liming Miao and Shuwei Qiu and Zexun Zhou and Peitao Wang and Zakir Ullah and Naveed Ur Rehman Junejo and Xueqi Cheng},
journal= {arXiv preprint arXiv:1810.12558},
year = {2025}
}