中文

超内积空间的线性多臂弧臂问题:基于最优传输的 Bandit 最优解

机器学习 2026-02-18 v2 机器学习

摘要

线性多臂弧臂问题长期以来一直是在线学习中的核心议题,广泛应用于推荐系统和自适应临床试验等场景。虽然其可学习性在目标最小化成本参数与决策变量之间内积结构时已被建立,但这种高度普适的内积结构掩盖了'线性'多臂弧臂名称的本质,无法处理诸如最优传输等问题。以最优传输的康托尔维奇(Kantorovich)公式为例,我们展示在内积结构下实现高效学习并非必然。我们提出了经典OFUL算法的一种改进方案,通过将动作集合嵌入希尔伯特子空间,在最小二乘估计基础上构建置信区间。随后通过惩罚乐观来约束动作落在该子空间内。最终借助对康托尔维奇问题的惩罚(熵)传输收敛结果进行分析。除近似项外,所得算法在轨迹 regret 上界与OFUL算法相同,进而通过函数回归技术转化为最坏情况 regret。其 regret 在 O~(T)\tilde{\mathcal O}(\sqrt{T})O(T){\mathcal O}(T) 之间插值,取决于成本函数的光滑性,在有限维情形下可恢复参数速率 O~(dT)\tilde{\mathcal O}(\sqrt{dT})

关键词

引用

@article{arxiv.2502.07397,
  title  = {Linear Bandits beyond Inner Product Spaces, the case of Bandit Optimal Transport},
  author = {Lorenzo Croissant},
  journal= {arXiv preprint arXiv:2502.07397},
  year   = {2026}
}