Hilbert 空间中漫游的多臂老虎机
量子物理
2025-09-30 v1 人工智能
机器学习
机器学习
摘要
本论文研究了在在线学习量子态属性中探索与利用之间的权衡。给定对未知量子态的流式访问,每轮我们从一组动作中选择一个可观测量,以最大化其期望值。利用过往信息,我们细化动作以最小化后悔;即当前奖励与最大可能奖励之间的累计差距。我们推导了信息论下界和匹配的上界的最优策略,表明后悔通常以轮数的平方根形式呈现。作为应用,我们将量子态 tomography 重新表述为既高效学习态的同时最小化测量扰动。对于纯态和连续动作,我们实现了基于加权在线最小二乘估计器的样本最优算法,以实现对数级后悔。该算法依赖于乐观原则并控制设计矩阵的特征值。我们还将我们的框架应用于量子推荐系统和来自未知态的热力学工作提取。在最后一种情况下,我们的结果表明,基于 tomography 的协议在能量耗散方面实现了指数级优势。
引用
@article{arxiv.2509.24569,
title = {Bandits roaming Hilbert space},
author = {Josep Lumbreras},
journal= {arXiv preprint arXiv:2509.24569},
year = {2025}
}
备注
PhD thesis, Centre for Quantum Technologies, National University of Singapore