中文

高维协变量下的在线决策遗憾最小化与统计推断

机器学习 2025-05-20 v2 机器学习

摘要

本文基于稀疏线性上下文多臂赌博机模型,研究了高维在线决策中的遗憾最小化、统计推断及其交互。我们将 ε\varepsilon-greedy 多臂赌博机算法与用于估计稀疏赌博机参数的硬阈值算法相结合,并引入了一种基于逆倾向加权去偏方法的推断框架。在间隔条件下,我们的方法实现了 O(T1/2)O(T^{1/2}) 遗憾或经典的 O(T1/2)O(T^{1/2}) 一致推断,表明探索与利用之间存在不可避免的权衡。若多样性协变量条件成立,我们证明纯贪婪多臂赌博机算法(即无探索算法)结合基于平均加权的去偏估计器可以同时实现最优的 O(logT)O(\log T) 遗憾和 O(T1/2)O(T^{1/2}) 一致推断。我们还表明,简单样本均值估计器可以为最优策略的值提供有效推断。数值模拟和华法林给药数据的实验验证了我们方法的有效性。

关键词

引用

@article{arxiv.2411.06329,
  title  = {Regret Minimization and Statistical Inference in Online Decision Making with High-dimensional Covariates},
  author = {Congyuan Duan and Wanteng Ma and Jiashuo Jiang and Dong Xia},
  journal= {arXiv preprint arXiv:2411.06329},
  year   = {2025}
}