中文

批量归一化在无策略 Actor-Critic 算法中的研究

机器学习 2025-09-30 v1

摘要

批量归一化 (BN) 在深入学习中发挥了关键作用,提高了训练稳定性,缓解了过拟合,并实现了更有效的优化。然而,由于数据本质上非独立同分布且由智能体学习过程导致分布动态变化,BN 在深度强化学习 (DRL) 中的采纳仍有限。本文我们认为,尽管面临这些挑战,BN 仍保留在 DRL 环境中的独特优势,特别是通过其随机性及其易于训练的能力。当正确应用于时,BN 能够适应演变的数据分布,并增强收敛速度和最终性能。为此,我们对 BN 在无策略 Actor-Critic 算法中的应用进行了全面实证研究,系统分析了不同训练和评估模式对性能的影响。我们进一步识别导致不稳定或发散的失效模式,分析其根本原因,并提出具实用可操作建议的模式感知批量归一化 (MA-BN) 方法。我们也实证验证,在 RL 环境中,MA-BN 可加速训练稳定性,扩大有效学习率范围,增强探索,并降低整体优化难度。我们的代码请参见:https://github.com/monster476/ma-bn.git。

关键词

引用

@article{arxiv.2509.23750,
  title  = {An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms},
  author = {Li Wang and Sudun and Xingjian Zhang and Wenjun Wu and Lei Huang},
  journal= {arXiv preprint arXiv:2509.23750},
  year   = {2025}
}