中文

多臂量子老虎机:学习量子态性质时的探索与利用

量子物理 2022-06-29 v3

摘要

我们开创了关于在线学习量子态性质中探索与利用权衡的研究。给定对未知量子态的序贯预言机访问,在每一轮中,我们的任务是从一组动作中选择一个可观测量,以最大化其在态上的期望值(奖励)。从先前轮次获得的关于未知态的信息可用于逐步改进动作选择,从而缩小奖励与给定动作集可达到的最大奖励之间的差距(遗憾值)。我们提供了最优学习器必须承受的累积遗憾的各种信息论下界,并证明其至少随已进行轮数次平方根 scaling。我们还研究了累积遗憾对可用动作数量和底层空间维度的依赖关系。此外,我们展示了在具有有限数量臂和一般混合态的老虎机中最优的策略。

关键词

引用

@article{arxiv.2108.13050,
  title  = {Multi-armed quantum bandits: Exploration versus exploitation when learning properties of quantum states},
  author = {Josep Lumbreras and Erkka Haapasalo and Marco Tomamichel},
  journal= {arXiv preprint arXiv:2108.13050},
  year   = {2022}
}

备注

36 pages, 3 figures