中文

在线鞍点问题与带背包约束的在线凸优化

机器学习 2020-04-07 v3 机器学习 最优化与控制

摘要

我们研究在线鞍点问题,这是一种在线学习问题,在每次迭代中需要在不知晓当前及未来(凸-凹)收益函数的情况下选择一对动作。目标是最小化累积收益与聚合收益函数的鞍点值之间的差距,我们使用称为“SP-Regret”的度量来衡量。该问题推广了在线凸优化框架,但此处我们必须确保两个参与者产生的累积收益都接近博弈之和的纳什均衡。我们提出一种算法,在一般情况下实现正比于 ln(T)T\sqrt{\ln(T)T} 的 SP-Regret,在强凸-凹情况下实现 log(T)\log(T) 的 SP-Regret。我们还考虑收益函数为双线性且决策集为概率单纯形的特殊情况。在此设定下,我们设计的算法将 SP-Regret 的界从对问题维度的线性依赖降低到对数依赖。我们还在强盗反馈下研究该问题,并提供一种实现次线性 SP-Regret 的算法。随后我们考虑受动态定价、拍卖和众包等广泛应用驱动的带背包约束的在线凸优化问题。我们将此问题关联到在线鞍点问题,并使用原始对偶算法建立了 O(T)O(\sqrt{T}) 的遗憾界。

关键词

引用

@article{arxiv.1806.08301,
  title  = {The Online Saddle Point Problem and Online Convex Optimization with Knapsacks},
  author = {Adrian Rivera and He Wang and Huan Xu},
  journal= {arXiv preprint arXiv:1806.08301},
  year   = {2020}
}