面向自适应控制的混合量子-经典策略梯度:VQC 与 MLP 的比较研究
量子物理
2025-10-08 v1 人工智能
机器学习
机器人学
系统与控制
系统与控制
摘要
对经典与量子强化学习 (QRL) 框架之间的比较进行了评估,以探讨它们在基准控制环境中的收敛行为、观测噪声下的鲁棒性以及计算效率。该研究以多层感知机 (MLP) 智能体作为经典基线,以可参数化的变分量子电路 (VQC) 作为量子对手,两者均在 CartPole-v1 环境中训练 500 个回合。经验结果显示,经典 MLP 实现了接近最优的策略收敛,平均回报为 498.7 +/- 3.2,在训练期间保持稳定的平衡。相比之下,VQC 表现有限,平均回报为 14.6 +/- 4.8,主要受限于电路深度和量子比特连通性。噪声鲁棒性分析进一步显示,MLP 策略在高斯扰动下能优雅地退化,而 VQC 在相同噪声水平下表现出更高的敏感性。尽管最终性能较低,VQC 具有显著更少的参数数量并略有增加的训练时间,这凸显了其在低资源量子处理器上的潜在可扩展性。结果表明,尽管当前控制基准中经典神经策略仍占主导地位,但量子增强的架构在硬件噪声和表达性限制得到缓解后,可能提供有前景的效率优势。
引用
@article{arxiv.2510.06010,
title = {Hybrid Quantum-Classical Policy Gradient for Adaptive Control of Cyber-Physical Systems: A Comparative Study of VQC vs. MLP},
author = {Aueaphum Aueawatthanaphisut and Nyi Wunna Tun},
journal= {arXiv preprint arXiv:2510.06010},
year = {2025}
}
备注
6 pages, 5 figures, 2 tables, 17 equations, 1 algorithm