无后悔博弈中的博弈重设计
计算机科学与博弈论
2021-10-25 v1 机器学习
摘要
我们研究博弈重设计问题,其中外部设计者有能力在每一轮改变收益函数,但因偏离原博弈而产生设计成本。玩家应用无后悔学习算法在有限反馈下重复玩被改变的博弈。设计者的目标是:(i)激励所有玩家频繁采取特定的目标行动组合;(ii)产生较小的累积设计成本。我们提出博弈重设计算法,保证目标行动组合在 T-o(T) 轮中被采用,同时仅产生 o(T) 的累积设计成本。博弈重设计描述了正向与负向两类应用:仁慈的设计者激励玩家采取相比原博弈解具有更优社会福利的目标行动组合,或恶意攻击者的目标行动组合使其自身受益却损害玩家利益。在四个经典博弈上的仿真证实了我们所提重设计算法的有效性。
引用
@article{arxiv.2110.11763,
title = {Game Redesign in No-regret Game Playing},
author = {Yuzhe Ma and Young Wu and Xiaojin Zhu},
journal= {arXiv preprint arXiv:2110.11763},
year = {2021}
}