中文

无上下文多样性假设下的 Logistic Bandits 及 $\tilde{O}(\sqrt{dT})$ Regret

机器学习 2026-05-01 v2

摘要

我们研究了 KK-臂 logistic bandit 问题,其中在每个回合中,智能体观察与 KK 个动作相关的 KK 个特征向量。现有的实现 O~(dT)\tilde{\mathcal{O}}(\sqrt{dT}) 的速率最优 regret 的方法依赖于上下文多样性假设,如上下文协方差矩阵最小特征值的严格正性。然而,这些假设对上下文过程施加了强烈限制,因为它们排除了上下文向量集中在低维子空间中的情形。本文提出了 SupSplitLog,据我们所知,这是第一个在无任何上下文多样性假设下实现 O~(dT)\tilde{\mathcal{O}}(\sqrt{dT}) regret 的 logistic bandit 算法。关键思想是将收集的样本分为两个互不相交的子集用于构造估计器;一个用于计算初始点估计器,另一个用于应用 Newton-type one-step 纠正程序。 splitting rule 被仔细设计,以平衡初始点估计器和 one-step 纠正程序的准确性要求。此外,SupSplitLog 在 regret 上限中对维数 dd 的依赖性方面严格改进了现有算法。 Furthermore, SupSplitLog 可以简单地适应,以推导出随数据相关复杂度度量增长的 regret 上界,避免对 dd 的直接依赖,这在上下文向量集中在低维子空间中尤为有利。我们还提供了实验结果,表明我们算法在数值上优于现有方法,验证了理论结果。

关键词

引用

@article{arxiv.2604.22161,
  title  = {Logistic Bandits with $\tilde{O}(\sqrt{dT})$ Regret without Context Diversity Assumptions},
  author = {Seoungbin Bae and Dabeen Lee},
  journal= {arXiv preprint arXiv:2604.22161},
  year   = {2026}
}