中文

乐观主义作为漏洞:对UCB赌博机跟随者的欺骗性Stackelberg控制

计算机科学与博弈论 2026-06-28 v1

摘要

上置信界(UCB)算法为学习未知随机环境的智能体保证了次线性遗憾,然而,使其统计高效(面对不确定性时的乐观主义)的同一原则,在面对全知的自适应领导者时,会诱发可预测的战略漏洞。经典的强Stackelberg均衡(SSE)假设跟随者立即对领导者承诺的混合行动做出最佳响应;因此,它为面对构建并依据经验奖励历史行动的有界理性跟随者的领导者提供了无机制设计处方。我们在有限时域重复Stackelberg博弈中形式化了这一冲突,并为欺骗性领导者机制给出了精确的构造性证明。在蜜罐阶段,领导者支付有限的信号成本来抬高指定跟随者行动的UCB指数。在陷阱阶段,领导者切换到自私的行动分布,而跟随者由于被操纵的经验历史和探索奖励主导了竞争指数,因此仍锁定在指定行动上。在明确的分离和收益假设下,领导者的累积效用严格超过经典SSE上限,并且操纵成本受O(TlnT)O(\sqrt{T\ln T})阶的遗憾计算限制。结果确定了静态均衡处方与动态学习的经验激励之间的形式不兼容性。

关键词

引用

@article{arxiv.2607.05423,
  title  = {Optimism as a Vulnerability: Deceptive Stackelberg Control of UCB Bandit Followers},
  author = {Şuayp Talha Kocabay and Kerem Yalçın and Talha Rüzgar Akkuş},
  journal= {arXiv preprint arXiv:2607.05423},
  year   = {2026}
}

备注

Accepted to the NExT-Game Workshop (New Frontiers in Game-Theoretic Learning) at ICML 2026. To be presented July 11, 2026, Seoul, South Korea