基于自适应置信带的保序重尾上下文_bandit_遗憾最小化
统计理论
2021-10-22 v1 统计理论
摘要
在本文中,我们开启了对均值奖励函数具有形状约束的非参数上下文_bandit_的研究。具体而言,我们研究这样一种设定:上下文为一维,且均值奖励函数关于该上下文是保序的。我们针对此问题提出一种策略,并证明其达到极小极大速率最优遗憾。此外,我们表明同一策略具有自动适应性;即,对于参数空间中真实均值奖励函数同时为具有 段的分段常数的子类,该策略对所有 同时保持极小极大速率最优。自动适应现象在离线条带约束问题中已为人所知;我们证明此类现象可延续至在线设定。我们策略背后的主要技术要素是利用保序分位数估计量推导底层保序函数的置信带的过程。我们提出的置信带在重尾噪声下有效,且其平均宽度以自适应最优速率趋于 。我们认为这是对保序回归文献的一项独立贡献。
引用
@article{arxiv.2110.10245,
title = {Regret Minimization in Isotonic, Heavy-Tailed Contextual Bandits via Adaptive Confidence Bands},
author = {Sabyasachi Chatterjee and Subhabrata Sen},
journal= {arXiv preprint arXiv:2110.10245},
year = {2021}
}