带侧观测的路径规划问题——当 Colonel 玩捉迷藏时
计算机科学与博弈论
2019-11-25 v2
摘要
诸如著名的 Colonel Blotto(CB)与 Hide-and-Seek(HS)游戏等资源分配博弈常被用来建模大量实际问题,但仅限于其一回合版本。确实,由于其极大的策略空间,如何在这些博弈中高效学习仍是一个开放问题。本工作中,我们表明在线 CB 与 HS 博弈可化为带侧观测(SOPPP)的路径规划问题:每一阶段,学习者在有向无环图上选择一条路径,并承受对抗性地赋给相应边的损失之和;随后她接收到带侧观测的半_bandit 反馈(即她观察到所选边及其他一些边上的损失)。我们提出一种新颖算法 EXP3-OE,它是首个无需任何辅助 oracle 即可保证 SOPPP 高效运行时间的此类算法。我们给出了 EXP3-OE 在 SOPPP 中的期望后悔界,与文献中最佳基准同阶。此外,我们引入关于可观测模型的额外假设,在此之下可进一步改进 EXP3-OE 的后悔界。通过将 EXP3-OE 应用于在线 CB 与 HS 博弈,我们说明了在 SOPPP 中使用该算法的益处。
引用
@article{arxiv.1911.09023,
title = {Path Planning Problems with Side Observations-When Colonels Play Hide-and-Seek},
author = {Dong Quan Vu and Patrick Loiseau and Alonso Silva and Long Tran-Thanh},
journal= {arXiv preprint arXiv:1911.09023},
year = {2019}
}
备注
This work was as replacement for arXiv:1905.11151 but was mistakenly submitted here as a new article