中文

Q-ARDNS-Multi:面向复杂 3D 环境的具元认知适应的多智能体量子强化学习框架

人工智能 2025-06-05 v1

摘要

本文提出了 Q-ARDNS-Multi,一种扩展自 ARDNS-FN-Quantum 模型的先进多智能体量子强化学习(QRL)框架,其中 Q-ARDNS-Multi 代表“量子自适应奖励驱动神经模拟器 - 多智能体”。它将量子电路与 RY 门、元认知适应以及多智能体协调机制相集成,适用于复杂 3D 环境。Q-ARDNS-Multi 利用 2 量子比特量子电路进行动作选择,采用受人类认知启发的双记忆系统、用于智能体协作的共享记忆模块,以及由奖励方差和内在动机调节的自适应探索策略。在具有两个智能体的 10×10×310 \times 10 \times 3 GridWorld 环境中经过 5000 个回合的评估,Q-ARDNS-Multi 为智能体 0 和智能体 1 分别实现了 99.6\% 和 99.5\% 的成功率,在成功率、稳定性、导航效率和碰撞避免方面均优于多智能体深度确定性策略梯度(MADDPG)和 Soft Actor-Critic(SAC)。该框架记录的平均奖励为 304.2891±756.4636-304.2891 \pm 756.4636295.7622±752.7103-295.7622 \pm 752.7103,平均花费 210 步到达目标,证明了其在动态环境中的鲁棒性。包括学习曲线、奖励分布、统计检验和计算效率评估在内的综合分析,突出了量子电路和元认知适应的贡献。通过连接量子计算、认知科学和多智能体强化学习,Q-ARDNS-Multi 为机器人技术、自主导航和不确定性下的决策制定应用提供了一种可扩展的、类人的方法。

关键词

引用

@article{arxiv.2506.03205,
  title  = {Q-ARDNS-Multi: A Multi-Agent Quantum Reinforcement Learning Framework with Meta-Cognitive Adaptation for Complex 3D Environments},
  author = {Umberto Gonçalves de Sousa},
  journal= {arXiv preprint arXiv:2506.03205},
  year   = {2025}
}

备注

17 pages, 5 figures