MHPO:用于稳定强化学习的调制危害感知策略优化
机器学习
2026-03-24 v2 人工智能
计算与语言
摘要
调节重要性比例是基于群相对策略优化(GRPO)框架训练稳定性的关键因素。然而,现有的比例控制方法,如硬性剪裁, suffer from non-differentiable boundaries and vanishing gradient regions, 无法维持梯度保真度。此外,这些方法缺乏危害感知机制,以自适应方式抑制极端偏差,使优化过程容易受到突发性策略变化的威胁。为解决这些挑战,我们提出了调制危害感知策略优化(MHPO),一个旨在实现稳健和稳定强化学习的新型框架。 proposed MHPO 引入对数保真调制器(LFM),将无界重要性比例映射到受限可微域域。该机制有效防止高方差异常标记物破坏损失景观,同时确保全局梯度稳定性。此外,解耦危害惩罚(DHP)集成了生存分析中的累积危害函数,独立调节正负策略偏移。通过融入危害感知惩罚塑造优化景观,所提出的 MHPO 同时实现了对非对称策略偏移的精细调控,减轻因过度扩张导致的模式坍缩,防止因灾难性收缩引起的策略侵蚀,处于已稳定的信任区域内。广泛的在 diverse reasoning benchmarks 上的评估,涵盖文本基和视觉语言任务,表明 MHPO 在保持优异性能的同时,显著提升了训练稳定性。
引用
@article{arxiv.2603.16929,
title = {MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning},
author = {Hongjun Wang and Wei Liu and Weibo Gu and Xing Sun and Kai Han},
journal= {arXiv preprint arXiv:2603.16929},
year = {2026}
}
备注
18 pages, 3 figures, 4 tables