中文

非阿贝尔环境下的量子强化学习:揭示新形式化与量子优势探索

量子物理 2024-06-12 v1 机器学习 概率论

摘要

本文深入探讨了量子强化学习(QRL)的最新进展,特别关注表示QRL领域中未探索的疆域的非交换环境。我们的研究旨在通过引入形式化和策略来重新定义决策边界,发掘量子系统固有的特性。在调查的核心是对agent状态空间在Hilbert空间 H\mathcal{H} 中的特征化。此处,量子态作为经典状态的复杂叠加,引入由酉算子支配的非交换量子动作,迫使对状态转移进行重新构想。补充这一框架的是根植于量子力学的细化奖励函数,作为Hilbert空间 H\mathcal{H} 上的厄米算子。这个奖励函数作为agent决策过程的基础。通过利用量子Bellman方程,我们建立了一种方法,用于在考虑量子系统相互作用的无限视角下最大化预期累积奖励。我们还将量子Bellman方程与纯代数中环境非交换性联系起来。我们设计了一个量子优势函数。这一巧妙设计的函数利用系统中内在的量子并行性,增强了agent的决策能力,为探索处于未知疆域的量子优势之路。 Furthermore, 我们直接解决了量子探索的重大挑战,认识到传统策略在这一复杂环境中的局限性。

关键词

引用

@article{arxiv.2406.06531,
  title  = {Quantum Reinforcement Learning in Non-Abelian Environments: Unveiling Novel Formulations and Quantum Advantage Exploration},
  author = {Shubhayan Ghosal},
  journal= {arXiv preprint arXiv:2406.06531},
  year   = {2024}
}