中文

面向光子实现的冲突无关多智能体 Q-learning 的 Bandit 方法

人工智能 2022-12-21 v1 多智能体系统 光学 量子物理

摘要

近年来,人们广泛研究了利用光的物理特性来加速计算过程的 photonic 强化学习。先前的研究利用光子的量子干涉,在解决竞争型多臂 bandit 问题(强化学习的基本示例)时实现无选择冲突的集体决策。然而,bandit 问题处理的是静态环境,其中智能体的动作不影响奖励概率。本研究旨在将传统方法扩展到更通用的多智能体强化学习,以网格世界问题为目标。与传统方法不同,所提方案处理的是因智能体动作而导致奖励变化的动态环境。成功的 photonic 强化学习方案既需要有助于学习质量的 photonic 系统,也需要合适的算法。本研究从潜在光子实现的角度提出了一种新颖的学习算法——不连续 bandit Q-learning。在此,环境中的状态-动作对被视作 bandit 问题中的老虎机,而 Q 值的更新量被视为 bandit 问题的奖励。我们进行数值模拟以验证该 bandit 算法的有效性。此外,我们提出了一种多智能体架构,其中智能体通过光的量子干涉间接连接,量子原理确保了智能体间状态-动作对选择的无冲突特性。我们证明了由于多智能体间的冲突避免,多智能体强化学习得以加速。

关键词

引用

@article{arxiv.2212.09926,
  title  = {Bandit approach to conflict-free multi-agent Q-learning in view of photonic implementation},
  author = {Hiroaki Shinkawa and Nicolas Chauvet and André Röhm and Takatomo Mihana and Ryoichi Horisaki and Guillaume Bachelier and Makoto Naruse},
  journal= {arXiv preprint arXiv:2212.09926},
  year   = {2022}
}

备注

19 pages, 8 figures, 1 table