中文

趋化策略在多智能体强化学习中的涌现

生物物理 2024-04-03 v1 机器学习 多智能体系统

摘要

强化学习(RL)是在复杂环境中对微型机器人进行编程的一种灵活且高效的方法。在此,我们研究强化学习在经过训练执行趋化性时是否能提供对生物系统的见解。即,我们是否能了解智能体如何处理给定信息以便向目标游动。我们运行了涵盖一系列智能体形状、大小和游动速度的模拟,以确定生物游动者的物理限制(即布朗运动)是否会导致强化学习器训练失败的区域。我们发现,RL 智能体在物理条件允许时即可执行趋化作用,在某些情况下,甚至在主动游动压倒随机环境之前就可以做到。我们研究了涌现策略的效率,并确定了在智能体大小和游动速度上的收敛性。最后,我们研究了强化学习算法采用的策略,以解释智能体如何完成其任务。为此,我们识别了三种涌现的主导策略以及几种罕见的处理方法。这些策略虽然在模拟中产生几乎相同的轨迹,但却是截然不同的,并为了解生物智能体探索其环境及响应条件变化的可能机制提供了见解。

关键词

引用

@article{arxiv.2404.01999,
  title  = {Emergence of Chemotactic Strategies with Multi-Agent Reinforcement Learning},
  author = {Samuel Tovey and Christoph Lohrmann and Christian Holm},
  journal= {arXiv preprint arXiv:2404.01999},
  year   = {2024}
}

备注

12 pages, 6 figures