中文

基于量子度量编码的离线强化学习性能提升

机器学习 2025-11-14 v1 人工智能 量子物理

摘要

在现实应用中, 强化学习常常面临样本有限的局面。然而, 在此约束下, 离线强化学习的性能往往次优。我们考虑通过引入量子度量编码器(QME)来处理样本有限的问题。在该方法中, 与直接对原始状态和奖励应用强化学习框架不同, 我们将状态嵌入更紧凑且更具意义的表示中, 其编码结构受量子电路启发。对于经典数据, QME 是一种可在经典设备上仿真的可训练单位嵌入, 从而作为量子灵感模块。对于以量子态形式出现的量子数据, QME 可以直接在量子硬件上实现, 允许在测量或重新编码的情况下进行训练。我们在三个数据集上评估了 QME, 每个数据集仅包含 100 个样本。我们使用 Soft-Actor-Critic(SAC)和 Implicit-Q-Learning(IQL),两种著名的强化学习算法, 来展示我们方法的有效性。从实验结果看, 在解码奖励后使用 QME 嵌入状态训练的离线强化学习智能体, 性能显著优于在原始状态和奖励上训练。在三个数据集中, 对于最大奖励性能, 我们对 SAC 实现了 116.2% 的提升, 对 IQL 实现了 117.6% 的提升。我们进一步研究了我们框架的 Δ\Delta-超几何性, 一种已知对 RL 训练效果重要的状态空间几何属性。QME 嵌入的状态表现出低 Δ\Delta-超几何性, 这表明嵌入后的改进源于 QME 引起的状态空间几何修改。因此, 低 Δ\Delta-超几何性和 QME 的相应有效性, 可为开发在有限样本条件下高效的离线强化学习方法提供有价值的信息。

关键词

引用

@article{arxiv.2511.10187,
  title  = {Improved Offline Reinforcement Learning via Quantum Metric Encoding},
  author = {Outongyi Lv and Yewei Yuan and Nana Liu},
  journal= {arXiv preprint arXiv:2511.10187},
  year   = {2025}
}