协作多目标赌博机中的通信-腐败耦合与验证
机器学习
2026-02-23 v2
摘要
我们研究了在对抗性腐败和有限验证下具有向量值奖励的协作随机多臂赌博机问题。在轮中的每一轮,个智能体各自选择一个臂,环境生成一个干净的奖励向量,而一个对手在全局腐败预算的约束下扰动观测到的反馈。性能通过团队遗憾来衡量,该遗憾基于一个坐标非递减的-Lipschitz标量化函数,涵盖了线性、切比雪夫和平滑单调效用函数。我们的主要贡献是通信-腐败耦合:我们证明,一个固定的环境端预算可以转化为从到的有效腐败水平,这取决于智能体是共享原始样本、充分统计量还是仅共享臂推荐。我们通过一个协议诱导的多重性泛函将其形式化,并证明了由所得有效腐败参数化的遗憾界。作为推论,共享原始样本可能遭受倍大的加性腐败惩罚,而共享摘要和仅共享推荐则保留了未放大的项,并实现了集中式速率的团队遗憾。我们进一步建立了信息论极限,包括一个不可避免的加性惩罚和一个高腐败区域,在此区域内,没有干净信息就不可能实现次线性遗憾。最后,我们刻画了全局验证观测预算如何恢复可学习性。即,验证在高腐败区域是必要的,并且一旦超过识别阈值就足够了,通过认证共享使得团队遗憾变得与无关。
引用
@article{arxiv.2601.11924,
title = {Communication-Corruption Coupling and Verification in Cooperative Multi-Objective Bandits},
author = {Ming Shi},
journal= {arXiv preprint arXiv:2601.11924},
year = {2026}
}