中文

线性情境多臂老虎机问题中的最佳两者之选

机器学习 2025-10-17 v2

摘要

我们研究了线性情境多臂老虎机问题,其中在每个轮次中,学习者选择一个动作以最小化给定情境下的损失,然后可以决定支付固定成本来观察任意臂的损失。基于Follow-the-Regularized-Leader框架,通过矩阵几何重抽样实现高效估计器,我们引入了一种计算高效的最佳两者之选(Best-of-Both-Worlds, BOBW)算法。我们证明该算法在对抗性情境下实现Θ(T2/3)\Theta(T^{2/3})的次优 regret,同时在(受损)随机情境中保证对数级regret。我们的ethods建立在\cite{BOBWhardproblems}中的框架中,用于设计BOBW算法处理“困难问题”,并针对我们所考虑的情境量身定制分析技术。

引用

@article{arxiv.2510.07424,
  title  = {Best-of-Both Worlds for linear contextual bandits with paid observations},
  author = {Nathan Boyer and Dorian Baudry and Patrick Rebeschini},
  journal= {arXiv preprint arXiv:2510.07424},
  year   = {2025}
}

备注

error in the proofs