中文

利用强化学习在图上寻找测地线

概率论 2020-10-13 v1

摘要

生物学中众所周知,蚂蚁能够通过连续的随机探索,在巢穴与食物间找到最短路径,而除其遗留的信息素外无任何通信手段。这一引人注目的现象已在实验中被观察,并被生物学文献中不同的平均场强化学习模型所建模。本文中,我们引入该现象的首个概率强化学习模型。在此模型中,蚂蚁探索一个有限图,其中两个节点被区分为巢穴与食物源。蚂蚁在该图上执行连续随机游走,从巢穴出发并在首次到达食物时停止,且每次随机游走的转移概率通过图的某种动态加权依赖于此前所有游走的实现。我们讨论了基于不同强化规则的该模型变体,并表明强化规则的细微改变可导致截然不同的结果。我们证明,在该模型的两个变体中,当底层图分别为任意串并行图与一个5边非串并行菱形图时,蚂蚁确实最终找到了巢穴与食物间的最短路径。两个证明均依赖于加权图上随机游走的电阻网络方法以及Rubin连续时间嵌入。串并行情形的证明利用了该类图的递归性质,而看似更简单的菱形情形的证明则相当复杂:其依赖于对某些随机逼近的精细分析,以及与标准及广义Pólya urn的多种耦合。

关键词

引用

@article{arxiv.2010.04820,
  title  = {Finding geodesics on graphs using reinforcement learning},
  author = {Daniel Kious and Cécile Mailler and Bruno Schapira},
  journal= {arXiv preprint arXiv:2010.04820},
  year   = {2020}
}