线性_bandit中平衡性能与理论保证的几何感知方法
机器学习
2025-05-20 v5 机器学习
摘要
本文的动机源于近期 维随机线性 bandit 文献中的研究,其揭示了一个令人不安的差异:诸如 Thompson 采样和 Greedy 等算法展现出良好的实证性能,但这与其悲观的理论后悔界形成对比。这一挑战源于如下事实:尽管这些算法在某些问题实例上可能表现糟糕,但它们通常在典型实例上表现出色。为此,我们提出了一种新的数据驱动技术,用于追踪围绕主问题参数的不确定性椭球的几何性质。该方法使我们能够为包括 Greedy、OFUL 和 Thompson 采样在内的广泛基类算法,构造一个融合几何信息的数据驱动频率主义后悔界。该结果使我们能够识别并“纠偏”基类算法表现糟糕的问题实例。经纠偏的算法在 期决策场景下实现了 阶的极小极大最优后悔,有效保持了基类算法的可取特性,包括其实证效能。我们给出了使用合成与真实数据的仿真结果以验证我们的发现。
引用
@article{arxiv.2306.14872,
title = {Geometry-Aware Approaches for Balancing Performance and Theoretical Guarantees in Linear Bandits},
author = {Yuwei Luo and Mohsen Bayati},
journal= {arXiv preprint arXiv:2306.14872},
year = {2025}
}