中文

线性_bandit中平衡性能与理论保证的几何感知方法

机器学习 2025-05-20 v5 机器学习

摘要

本文的动机源于近期 dd 维随机线性 bandit 文献中的研究,其揭示了一个令人不安的差异:诸如 Thompson 采样和 Greedy 等算法展现出良好的实证性能,但这与其悲观的理论后悔界形成对比。这一挑战源于如下事实:尽管这些算法在某些问题实例上可能表现糟糕,但它们通常在典型实例上表现出色。为此,我们提出了一种新的数据驱动技术,用于追踪围绕主问题参数的不确定性椭球的几何性质。该方法使我们能够为包括 Greedy、OFUL 和 Thompson 采样在内的广泛基类算法,构造一个融合几何信息的数据驱动频率主义后悔界。该结果使我们能够识别并“纠偏”基类算法表现糟糕的问题实例。经纠偏的算法在 TT 期决策场景下实现了 O~(dT)\tilde{\mathcal{O}}(d\sqrt{T}) 阶的极小极大最优后悔,有效保持了基类算法的可取特性,包括其实证效能。我们给出了使用合成与真实数据的仿真结果以验证我们的发现。

关键词

引用

@article{arxiv.2306.14872,
  title  = {Geometry-Aware Approaches for Balancing Performance and Theoretical Guarantees in Linear Bandits},
  author = {Yuwei Luo and Mohsen Bayati},
  journal= {arXiv preprint arXiv:2306.14872},
  year   = {2025}
}