反馈在臂消失的多臂老虎机问题中是否有帮助?
机器学习
2026-01-21 v1 机器学习
摘要
我们研究了在臂消失信道上的分布式多臂老虎机 (MAB) 问题,这由于 MAB 算法在通信受限网络中的日益增长的采用所激发。 在该设置中,学习者以概率 将所选 arm 的请求发送给 agent;若发生消失,agent 将继续拉取最后一次成功接收的 arm;学习者始终观察所拉取 arm 的奖励。在过去的工作中,我们考虑了 agent 无法向学习者传递反馈的情况,因而学习者不知道所执行的 arm 是请求的还是最后一次成功接收的。在本文中,我们考虑 agent 可以向学习者发送反馈以指示 arm 请求是否被接收的情况,因而学习者准确知道所执行的 arm。令人惊讶的是,我们证明了即使存在消失反馈,最坏情况下的累积失效率上界阶数也不会优于此前研究的无反馈设置。具体地,我们证明了累积失效率下界为 ,其中 为 arm 的数量, 为时间范围;这与无反馈上界在对数因子上匹配。我们指出,反馈的存在使得更简单的数据结构设计成为可能,这些设计虽然不能获得更好的阶数失效率上界,却可能实现更好的常数因子;我们设计了一种此类算法并对其进行数值评估。
引用
@article{arxiv.2504.20894,
title = {Does Feedback Help in Bandits with Arm Erasures?},
author = {Merve Karakas and Osama Hanna and Lin F. Yang and Christina Fragouli},
journal= {arXiv preprint arXiv:2504.20894},
year = {2026}
}