中文

面向实例最优在线学习的 SMART 方法

机器学习 2024-02-28 v1 数据结构与算法 信息论 math.IT

摘要

我们设计了一种在线学习算法——名为通过单调适应 regret 轨迹进行切换 (SMART)——该算法能适应数据并实现实例最优 regret,即在每个输入序列上同时与 follow-the-leader (FTL) 策略的性能以及任何其他输入策略的最坏情况保证具有竞争力。我们证明,SMART 策略在任何输入序列上的 regret 均在乘法因子 e/(e1)1.58e/(e-1) \approx 1.58 以内,该因子作用于以下两者中的较小值:1) FTL 在该序列上获得的 regret,以及 2) 给定最坏情况策略所保证的 regret 上界。这意味着比典型的“两全其美”界限更严格的保证,因为该保证适用于每个输入序列,无论其如何生成。SMART 易于实现,因为它从执行 FTL 开始,并在时间范围内最多切换到最坏情况算法一次。我们的方法和结果源于将实例最优在线学习操作性地归约为滑雪租赁问题的竞争分析。除了竞争比率上界外,我们还补充了一个基本下界,表明在所有输入序列上,没有任何算法能优于 FTL 和 minimax 最优策略所实现的最小 regret 的 1.431.43 倍。我们还提出了 SMART 的一种修改版本,将 FTL 与“小损失”算法相结合,以实现 FTL regret 与小损失 regret 界之间的实例最优性。

关键词

引用

@article{arxiv.2402.17720,
  title  = {The SMART approach to instance-optimal online learning},
  author = {Siddhartha Banerjee and Alankrita Bhatt and Christina Lee Yu},
  journal= {arXiv preprint arXiv:2402.17720},
  year   = {2024}
}