中文

零阶优化实质是单步策略优化

机器学习 2025-06-18 v1

摘要

零阶优化(ZOO)为优化缺乏显式梯度或计算成本高昂的函数提供了强大的工具。然而,主流 ZOO 方法(尤其是采用随机有限差分的方法)的 underlying 机制以及其与强化学习(RL)等其他优化范式之间的联系尚未完全阐明。本文建立了一种根本且此前未被认识的联系:零阶优化与单步策略优化(PO)的特定实例等价。我们正式揭示,常见 ZOO 算法优化的隐式平滑目标函数恰好等于单步 PO 目标函数。此外,我们表明广泛使用的 ZOO 梯度估计器在数学上等价于具有特定基线函数的 REINFORCE 梯度估计器,从 PO 视角阐明了 ZOO 中的降低方差机制。建立在统一框架之上,我们提出 ZoAR(Zeroth-Order Optimization with Averaged Baseline and Query Reuse),一种新型 ZOO 算法,融合了来自 PO 启发的降低方差技术:来自最近评估的平均基线以及类似经验回放的查询重用。我们的理论分析进一步论证这些技术可降低方差并提升收敛性能。广泛的实证研究验证了我们的理论并表明 ZoAR 在收敛速度和最终性能方面显著优于其他方法。总体而言,本工作为理解 ZOO 提供了新的理论视角,并为其与 PO 联系提供了实用性改进。

关键词

引用

@article{arxiv.2506.14460,
  title  = {Zeroth-Order Optimization is Secretly Single-Step Policy Optimization},
  author = {Junbin Qiu and Zhengpeng Xie and Xiangda Yan and Yongjie Yang and Yao Shu},
  journal= {arXiv preprint arXiv:2506.14460},
  year   = {2025}
}