中文

面向离散状态空间有限回合游戏的量子增强强化学习

量子物理 2017-09-18 v3 信息论 math.IT

摘要

量子退火算法属于启发式工具类,适用于求解二元优化问题。量子退火的硬件实现,如 D-Wave Systems 生产的量子退火机,已接受多项研究分析,旨在表征该技术在优化和采样任务中的实用性。在此,我们提出了一种方法,用于部分嵌入蒙特卡洛策略迭代以在随机观测上寻找最优策略,以及如何将 (n) 个次优状态价值函数嵌入到 D-Wave 2000Q 量子处理单元 (QPU) 上,以近似给定策略下离散状态空间有限回合游戏的改进状态价值函数。我们解释了如何将这些问题的两部分都表示为二次无约束二元优化 (QUBO) 问题,并表明量子增强蒙特卡洛策略评估能够在与纯经典蒙特卡洛算法相同的回合数下,为给定策略找到等效或更优的状态价值函数。此外,我们描述了一种量子 - 经典策略学习算法。我们的首要目标是解释如何借助 QPU 表示和求解这些问题的部分,而非证明其优于每一种现有的经典策略评估算法。

关键词

引用

@article{arxiv.1708.09354,
  title  = {Quantum-enhanced reinforcement learning for finite-episode games with discrete state spaces},
  author = {Florian Neukart and David Von Dollen and Christian Seidel and Gabriele Compostella},
  journal= {arXiv preprint arXiv:1708.09354},
  year   = {2017}
}

备注

17 pages, 7 figures