基于 1 位反馈的分位数多臂老虎机
机器学习
2025-02-11 v1 信息论
机器学习
math.IT
摘要
本文研究了一种涉及风险敏感性和通信约束的多臂老虎机变体。具体而言,学习者的目标是在仅限每臂 1 位反馈的通信限制下,识别出最高分位数奖励的那一臂。我们提出了一种算法,利用带噪声的二分搜索作为子程序,使学习者通过 1 位反馈估计分位数奖励。我们推导了该算法的实例相关上界,并为特定实例提供算法无关的下界;在温和条件下,这两个上界和下界在对数因子范围内相符,甚至在某些低错误概率扩展 regime 下甚至在常数因子范围内相符。该下界即使在缺乏通信约束的情况下也适用,因此我们得出结论,限制为 1 位反馈对样本复杂度的比例影响甚微。
引用
@article{arxiv.2502.06678,
title = {Quantile Multi-Armed Bandits with 1-bit Feedback},
author = {Ivan Lau and Jonathan Scarlett},
journal= {arXiv preprint arXiv:2502.06678},
year = {2025}
}
备注
ALT 2025