中文

学习采样策略以加速无导数优化

机器学习 2021-04-12 v1

摘要

零阶(ZO,又称无导数)方法仅通过两次函数求值来估计梯度,因其在机器学习领域的广泛应用而近期备受关注。这两次函数求值通常由标准高斯分布随机扰动生成。为加速 ZO 方法,近期已有许多方法被提出以降低 ZO 梯度的方差,例如方差缩减随机 ZO 梯度以及学习自适应高斯分布。然而,是否存在进一步改善 ZO 方法收敛性的空间仍是一个开放问题。为探索该问题,本文提出一种新的基于强化学习的 ZO 算法(ZO-RL),通过学习采样策略来生成 ZO 优化中的扰动,而非使用随机采样。为寻找最优策略,采用了一种称为深度确定性策略梯度(DDPG)的 actor-critic 强化学习算法,并配备两个神经网络函数逼近器。所学得的采样策略引导参数空间中的扰动点,以估计更准确的 ZO 梯度。据我们所知,我们的 ZO-RL 是首个利用强化学习为 ZO 优化学习采样策略的算法,与现有方法并行。特别地,我们的 ZO-RL 可与现有 ZO 算法结合,从而进一步加速这些算法。针对不同 ZO 优化问题的实验结果表明,我们的 ZO-RL 算法能通过学习的采样策略有效降低 ZO 梯度的方差,并在不同场景下比现有 ZO 算法收敛更快。

关键词

引用

@article{arxiv.2104.04405,
  title  = {Learning Sampling Policy for Faster Derivative Free Optimization},
  author = {Zhou Zhai and Bin Gu and Heng Huang},
  journal= {arXiv preprint arXiv:2104.04405},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1910.09464 by other authors