带边观测的路径规划问题——当上校们玩捉迷藏时
计算机科学与博弈论
2019-12-05 v3 机器学习
摘要
资源分配博弈如著名的上校博弈(Colonel Blotto, CB)和捉迷藏(Hide-and-Seek, HS)博弈常被用来建模大量实际问题,但仅限于其单轮版本。事实上,由于其极大的策略空间,如何在这些博弈中高效学习仍是一个开放问题。本工作中,我们表明在线 CB 和 HS 博弈可化为带边观测的路径规划问题(SOPPP):在每一阶段,学习者有向无环图上选择一条路径,并承受对抗性地分配给相应边的损失之和;随后她接收到带边观测的半赌博机反馈(即她观察到所选边及另一些边上的损失)。我们提出一种新颖算法 EXP3-OE,它是首个无需任何辅助预言机、对 SOPPP 具有保证高效运行时间的同类算法。我们给出了 EXP3-OE 在 SOPPP 中的期望后悔界,与文献中最佳基准同阶。此外,我们在可观测性模型上引入额外假设,可进一步改进 EXP3-OE 的后悔界。我们通过将 EXP3-OE 应用于在线 CB 和 HS 博弈来说明其在 SOPPP 中的益处。
引用
@article{arxiv.1905.11151,
title = {Path Planning Problems with Side Observations-When Colonels Play Hide-and-Seek},
author = {Dong Quan Vu and Patrick Loiseau and Alonso Silva and Long Tran-Thanh},
journal= {arXiv preprint arXiv:1905.11151},
year = {2019}
}
备注
Previously, this work appeared as arXiv:1911.09023 which was mistakenly submitted as a new article (has been submitted to be withdrawn). This is a preprint of the work published in Proceedings of the 34th AAAI Conference on Artificial Intelligence (AAAI)