面向上下文推荐的简单投影自由算法: Logarithmic Regret 与鲁棒性
机器学习
2026-04-02 v2
摘要
上下文推荐是上下文线性多臂盒的一种变体,学习者观察的是(最优)动作而非奖励标量。最近,Sakaue 等人(2025)开发了一种高效的 Online Newton Step(ONS)方法,具有 regret 上界,其中 为动作空间维数, 为时间范围。本文提出一种算法,比 ONS 方法更高效,同时实现相同的 regret 保证。我们的核心思想是利用上下文推荐的非规范性,导致一种类似于在线分类中第二阶感知机的更新规则。这一做法消除了 ONS 所需的马哈努里斯投影步骤,这通常是主要的计算瓶颈。更重要的是,同一算法对可能次优动作反馈保持鲁棒性,而先前的 ONS 方法需要针对这一扩展运行多个不同学习率的 ONS 学习者。我们描述了该方法在通用希尔伯特空间中的工作方式(例如通过核化),在消除马哈努里斯投影后优势更为显著。
引用
@article{arxiv.2603.20826,
title = {Simple Projection-Free Algorithm for Contextual Recommendation with Logarithmic Regret and Robustness},
author = {Shinsaku Sakaue},
journal= {arXiv preprint arXiv:2603.20826},
year = {2026}
}