Stackelberg 惩罚与自动驾驶汽车的防欺凌策略
人机交互
2019-08-26 v1 人工智能
计算机科学与博弈论
摘要
重复博弈中的互利行为可以通过惩罚威胁来强制执行,这体现在博弈论著名的“民间定理”中。然而,玩家为产生这些负向激励需要付出代价。在本工作中,我们试图通过计算一种“Stackelberg 惩罚”来最小化这一代价,即玩家选择一种行为,在假设对方将采取最佳响应的前提下,既能充分惩罚对方,又能最大化自身得分。这一思想推广了 Stackelberg 均衡的概念。已知用于计算 Stackelberg 均衡的高效算法可被改造以高效生成 Stackelberg 惩罚。我们在一个涉及虚拟自动驾驶汽车与人类参与者的实验中展示了该思想的应用。我们发现,在需要社会协商的驾驶场景中,采用 Stackelberg 惩罚策略的自动驾驶汽车能够阻止人类驾驶员的欺凌行为。
引用
@article{arxiv.1908.08641,
title = {Stackelberg Punishment and Bully-Proofing Autonomous Vehicles},
author = {Matt Cooper and Jun Ki Lee and Jacob Beck and Joshua D. Fishman and Michael Gillett and Zoë Papakipos and Aaron Zhang and Jerome Ramos and Aansh Shah and Michael L. Littman},
journal= {arXiv preprint arXiv:1908.08641},
year = {2019}
}
备注
10 pages, The 11th International Conference on Social Robotics