中文

量子策略梯度的可训练性问题

量子物理 2024-06-17 v1 机器学习

摘要

本研究探讨了基于参数化量子电路的强化学习策略的可训练性,这一领域最近年来呈现出显著的实证探索。尽管一些研究表明使用量子梯度估计可实现更好的样本复杂度,但这些策略的有效可训练性仍是一个开放问题。我们的发现揭示了显著的挑战,包括具有指数级小梯度的标准梯度平坦问题以及梯度爆炸。这些现象取决于基态分区类型以及将这些分区映射到动作的方式。对于多于一个动作的情形,如果采用类似连续的分区方式,则可以通过多项测量次数确保可训练窗口。我们在多臂老虎机环境中对这些结果进行了实证验证。

关键词

引用

@article{arxiv.2406.09614,
  title  = {Trainability issues in quantum policy gradients},
  author = {André Sequeira and Luis Paulo Santos and Luis Soares Barbosa},
  journal= {arXiv preprint arXiv:2406.09614},
  year   = {2024}
}