量子青蛙:量子化时间合作游戏中的涌现合作与难度扩展
人工智能
2026-05-26 v1 机器学习
多智能体系统
摘要
我们引入 Quantum Frog,一个基于 novel 量子化时间机制构建的两人合作游戏,环境仅在玩家行动时才推进。受经典街机游戏 Frogger 的启发,Quantum Frog 需要两只青蛙一起穿过 8×8 的交通网格并到达对方。我们使用强化学习 (RL) 作为分析工具来回答四个设计问题:(1) 游戏难度如何随交通密度扩展,(2) 最优单智能体策略是什么以及为什么,(3) 独立与合作两智能体玩法之间的合作差距有多大,(4) 当激励代理合作时会出现什么联合策略。我们通过五个逐步递增的阶段训练智能体:Tabular Q-Learning、Deep Q-Network (DQN)、Independent DQN (IDQN) 和 Multi-Agent Proximal Policy Optimisation (MAPPO with a centralised critic),在交通密度从 1 到 6 的不同水平下对每个方法进行评估。我们的关键发现包括:(i) 量子化时间机制使 "冲刺策略"(每一步都直接向上移动)普遍最优,因为最小化了暴露于交通的时间;(ii) 添加一个非协调的第二位玩家比单人专家玩家增加四倍交通更难;(iii) 合作训练相对于独立智能体恢复了 +32--34 个百分点的联合成功率,并将 episode 长度从 ~90 缩短到 ~6 步;(iv) 涌现的合作策略是同步冲刺,而非复杂的positional 协调,说明共享激励本身就足以在时间关键的合作任务中使智能体对齐。这些发现为 Quantum Frog 的商业设计提供了具体且经验 grounding 的指导,并为环境机制在塑造多智能体学习动态中发挥作用提供了更广泛的见解。
引用
@article{arxiv.2605.23930,
title = {Quantum Frog: Emergent Cooperation and Difficulty Scaling in a Quantized-Time Cooperative Game},
author = {Saad Mankarious},
journal= {arXiv preprint arXiv:2605.23930},
year = {2026}
}