OpenAI Gym 中无纠缠的量子强化学习智能体
量子物理
2022-03-29 v1 统计力学
摘要
经典强化学习(RL)在不同领域取得了优异成果,但其样本效率低下仍是一个关键问题。本文给出具体数值证据,表明量子 RL 的样本效率(收敛速度)可能优于经典 RL,且为取得相当的学习性能,量子 RL 所需的可训练参数可比经典 RL 少得多(至少低一个数量级)。具体而言,我们利用 OpenAI Gym 中流行的 RL 基准环境,表明在相同优化过程下,我们的量子 RL 智能体在 CartPole 和 Acrobot 任务中比经典全连接神经网络(FCNs)收敛更快。我们还成功训练了首个能完成 OpenAI Gym 中 LunarLander 任务的量子 RL 智能体。我们的量子 RL 智能体仅需一个基于单量子比特的变分量子线路(不含纠缠门),后接一个经典神经网络(NN)对测量输出进行后处理。最终,我们能在真实的 IBM 量子机器上完成上述任务。据我们所知,此前的量子 RL 智能体均无法实现。
引用
@article{arxiv.2203.14348,
title = {Unentangled quantum reinforcement learning agents in the OpenAI Gym},
author = {Jen-Yueh Hsiao and Yuxuan Du and Wei-Yin Chiang and Min-Hsiu Hsieh and Hsi-Sheng Goan},
journal= {arXiv preprint arXiv:2203.14348},
year = {2022}
}
备注
13 pages, 6 figures