中文

抗策略性复制的多臂 Bandit 算法

机器学习 2021-10-26 v1 计算机科学与博弈论 机器学习

摘要

我们考虑一个多臂 bandit 问题,其中每个智能体注册一组臂,并在其臂被选中时获得奖励。一个智能体可能策略性地提交更多带复制的臂,从而通过滥用 bandit 算法的探索-利用平衡带来更多奖励。我们的分析揭示,标准算法确实无法阻止复制,并在时间 TT 内遭受线性后悔。我们旨在设计一种抑制复制且能实现较小累积后悔的 bandit 算法。我们设计了防复制的层次化 UCB(H-UCB),其在任何均衡下具有 O(lnT)O(\ln T) 后悔。我们进一步提出鲁棒层次化 UCB(RH-UCB),即使在存在粗心复制的非理性智能体的现实场景下也具有亚线性后悔。我们通过数值实验验证了我们的理论发现。

关键词

引用

@article{arxiv.2110.12160,
  title  = {Multi-armed Bandit Algorithm against Strategic Replication},
  author = {Suho Shin and Seungjoon Lee and Jungseul Ok},
  journal= {arXiv preprint arXiv:2110.12160},
  year   = {2021}
}