中文

HGFormer:基于强化学习的两阶段 Colonel Blotto 游戏的层次图变换框架

人工智能 2025-06-11 v1

摘要

两阶段 Colonel Blotto 游戏代表了典型的对抗性资源分配问题,其中两个对抗性代理人依次在网络拓扑中分配资源,分为两个阶段:初始资源部署 followed by multiple rounds of dynamic reallocation adjustments。阶段之间的序列依赖性以及由图拓扑施加的复杂约束,使得传统方法难以达到全局最优策略。为此,我们提出了称为 HGformer 的层次图变换框架。通过纳入带有结构偏置的增强图变换编码器和双代理人层次决策模型,我们的方法能够高效地生成大规模对抗环境中的政策。此外,我们设计了一种按层反馈强化学习算法,将来自低层决策的长期回报反馈到高层策略的优化中,从而弥合两个决策阶段之间的协调差距。实验结果表明,与现有的层次决策或图神经网络方法相比,HGformer 在资源分配效率和对抗性收益方面显著提高,在复杂动态游戏情景中实现了卓越的整体性能。

关键词

引用

@article{arxiv.2506.08580,
  title  = {HGFormer: A Hierarchical Graph Transformer Framework for Two-Stage Colonel Blotto Games via Reinforcement Learning},
  author = {Yang Lv and Jinlong Lei and Peng Yi},
  journal= {arXiv preprint arXiv:2506.08580},
  year   = {2025}
}