预算约束下动态上校博弈中的在线学习
机器学习
2023-09-13 v4 计算机科学与博弈论
多智能体系统
系统与控制
系统与控制
摘要
在本文中,我们研究在动态设定下利用上校博弈(CBG)进行有限资源的策略性分配,并采用在线学习方法分析该问题。在此模型中,其中一名参与者为学习者,其在有限时间范围内可分配的兵力有限,另一名参与者为对手。在每一轮中,学习者与对手进行一次性上校博弈,并基于过往观测策略性地决定在各战场间的兵力分配。对手从其固定分布中随机选择分配动作,该分布对学习者为未知。学习者的目标是最小化其遗憾值,即最佳混合策略的累积奖励与遵循学习算法所实现的累积奖励之差,同时不违反预算约束。动态 CBG 中的学习在组合赌博机与带背包的赌博机框架下进行分析。我们首先将预算约束动态 CBG 转化为有向图上的路径规划问题。随后我们设计了一种高效算法,该算法结合了用于路径规划问题的特殊组合赌博机算法与带背包的赌博机算法以应对预算约束。理论分析表明,学习者的遗憾值上界为关于时间范围次线性、关于其他参数多项式的项。最后,我们通过针对不同场景的仿真验证了理论结果。
引用
@article{arxiv.2103.12833,
title = {Online Learning in Budget-Constrained Dynamic Colonel Blotto Games},
author = {Vincent Leon and S. Rasoul Etesami},
journal= {arXiv preprint arXiv:2103.12833},
year = {2023}
}