中文

一种用于黑盒学习与控制的单点残差反馈预言机

最优化与控制 2021-09-09 v2 机器学习 机器学习

摘要

零阶优化(ZO)算法近来被用于求解黑盒或基于仿真的学习与控制问题,其中目标函数的梯度不易计算但可利用目标函数值进行近似。许多现有ZO算法采用两点反馈方案,因为相较于单点反馈方案其收敛速度更快。然而,两点方案在每次迭代中需要对目标函数进行两次求值,这在数据并非全部先验可得的应用中(例如在线优化)可能是不切实际的。本文提出一种新颖的单点反馈方案,在每次迭代中仅查询一次函数值,并利用两个连续点之间的残差来估计梯度。在优化确定性Lipschitz函数时,我们证明采用所提单点残差反馈的ZO的查询复杂度与采用现有两点方案的ZO相匹配。此外,当目标函数具有Lipschitz梯度时,所提算法的查询复杂度可进一步改善。进而,对于仅给出带噪声目标函数值的随机bandit优化问题,我们证明采用单点残差反馈的ZO取得了与采用不可控数据样本的两点方案相同的收敛速率。我们通过大量数值实验证明了所提单点残差反馈的有效性。

关键词

引用

@article{arxiv.2006.10820,
  title  = {A New One-Point Residual-Feedback Oracle For Black-Box Learning and Control},
  author = {Yan Zhang and Yi Zhou and Kaiyi Ji and Michael M. Zavlanos},
  journal= {arXiv preprint arXiv:2006.10820},
  year   = {2021}
}