对数屏障如何帮助策略优化中的探索
机器学习
2026-05-11 v2 人工智能
摘要
最近的研究表明,随机梯度赤道(SGB)算法可在常数学习率下收敛至全局最优策略,但这些保证依赖于关于学习过程的不切实际假设,即最优动作的概率始终被保持在非零值之外。我们认为这源于SGB缺乏显式的探索机制。为解决这些限制,我们提出在SGB目标函数上加以对数屏障正则化,结构性地强制执行最小限度的探索。我们证明,Log-Barrier随机梯度赤道(LB-SGB)匹配SGB的样本复杂度,同时在无需对学习过程作任何假设的情况下收敛(收敛速度较慢)。我们还展示了对数屏障正则化与自然策略梯度之间的联系,二者均通过控制策略空间中的Fisher信息来利用其几何结构。我们通过数值仿真验证了这些理论结果,表明对数屏障正则化具有实际益处。
引用
@article{arxiv.2603.15001,
title = {How Log-Barrier Helps Exploration in Policy Optimization},
author = {Leonardo Cesani and Matteo Papini and Marcello Restelli},
journal= {arXiv preprint arXiv:2603.15001},
year = {2026}
}