中文

对抗环境下采用振幅放大探索的量子_bandit算法

量子物理 2023-05-23 v2 系统与控制 系统与控制

摘要

学习系统在任意变化环境中的迅速扩散,使得管理探索与利用之间的张力成为必需。本工作针对基于学习与适应的卸载问题,提出一种量子启发的bandit学习方法,其中客户端观察并学习卸载至候选资源提供者(如雾节点)的各项任务代价。该方法分别受量子计算理论中振幅放大与坍缩公设的启发,采用了一种新的动作更新策略与新颖的概率性动作选择。我们设计了量子域(如Grover型搜索算法)中量子力学相位与基于价值的决策域(如对抗多臂bandit算法)中提炼的概率幅之间的局部线性映射。所提算法通过该映射得到推广,以更好地对有利/不利动作进行学习权重调整,并通过仿真验证了其有效性。

关键词

引用

@article{arxiv.2208.07144,
  title  = {Quantum bandit with amplitude amplification exploration in an adversarial environment},
  author = {Byungjin Cho and Yu Xiao and Pan Hui and Daoyi Dong},
  journal= {arXiv preprint arXiv:2208.07144},
  year   = {2023}
}

备注

Accepted to appear in IEEE TKDE