中文

ARDNS-FN-Quantum:基于量子增强的强化学习框架,实现认知启发式自适应探索以应对动态环境

机器学习 2025-05-13 v1 人工智能

摘要

强化学习(RL)已彻底变革了序列决策,但像深度Q网络(DQN)和近端策略优化(PPO)等传统算法在动态环境中常面临高效探索、稳定性和适应性不足的问题。本研究提出了ARDNS-FN-Quantum(Adaptive Reward-Driven Neural Simulator with Quantum enhancement,奖励驱动神经模拟器),这是一种新型框架,集成了用于动作选择的2量子比特量子电路、受人类认知启发的双记忆系统,以及由奖励方差和好奇心调节的自适应探索策略。在10×10的网格世界中进行20,000个episode的评估,ARDNS-FN-Quantum实现了99.5%的成功率(相较于DQN的81.3%和PPO的97.0%),所有episode的平均奖励为9.0528(相较于DQN的1.2941和PPO的7.6196),到达目标的平均步数为46.7(相较于DQN的135.9和PPO的62.5)。在最后100个episode中,其平均奖励为9.1652(相较于DQN的7.0916和PPO的9.0310),到达目标步数为37.2(相较于DQN的52.7和PPO的53.4)。通过学习曲线、步数-目标趋势、奖励方差和奖励分布等图形分析,证明了ARDNS-FN-Quantum在稳定性(所有episode奖励方差为5.424,远低于DQN的252.262和PPO的76.583)和效率方面的优势。通过将量子计算、认知科学与RL相结合,ARDNS-FN-Quantum提供了一种可扩展的、类似人的自适应学习方法,适用于机器人、自动驾驶系统和不确定环境下的决策。

关键词

引用

@article{arxiv.2505.06300,
  title  = {ARDNS-FN-Quantum: A Quantum-Enhanced Reinforcement Learning Framework with Cognitive-Inspired Adaptive Exploration for Dynamic Environments},
  author = {Umberto Gonçalves de Sousa},
  journal= {arXiv preprint arXiv:2505.06300},
  year   = {2025}
}

备注

19 pages, 7 figures