中文

基于主动重要抽样的 Actor-Critic 方法

机器学习 2026-05-11 v1

摘要

本文介绍了一种基于主动重要抽样的 Actor-Critic 方法(Active-Importance-Sampling Actor-Critic, AISAC),这是一种用于降低策略梯度估计方差的 Actor-Critic 框架扩展。AISAC 通过最小化行为策略的梯度方差来优化行为策略,同时保持无偏梯度估计。运用重要抽样原理,该算法将行为策略调整为与目标策略梯度相匹配的高效数据收集分布。对于连续动作空间,AISAC 采用高斯行为策略,通过交叉熵最小化进行优化。我们提供了理论分析,证明方差降低和无偏性。在 Inversion Pendulum 和 Half Cheetah 任务上的实验结果表明,与标准 Actor-Critic 方法相比,AISAC 在学习速度、样本效率和训练稳定性方面均取得改进。结果表明,优化行为策略不仅改善了目标策略更新,还提高了 critic 估计的准确性,无论是哪种超参数设置。AISAC 加速收敛并稳定强化学习训练,具有在实际应用中推广的前景。未来工作包括与诸如 Soft Actor-Critic 和 TD3 等高级算法集成,以应对更复杂的环境。

关键词

引用

@article{arxiv.2605.07094,
  title  = {Actor-Critic with Active Importance Sampling},
  author = {Majid Molaei and Gabor Paczolay and Matteo Papini and Alberto Maria Metelli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2605.07094},
  year   = {2026}
}