从信息素到政策:强化学习用于工程化生物群体
人工智能
2025-09-25 v1
摘要
群体智能源于简单智能体之间非中心化的相互作用,使集体问题解决成为可能。本研究在理论上建立了信息素介导的聚集在 \celeg\ 和强化学习 (RL) 之间的等价性,表明 stigmergic 信号如何作为分布式奖励机制发挥作用。我们对进行 foraging 任务的工程化线虫群体进行建模,展示了信息素动力学在数学上镜像 cross-learning updates,这是一种 fundamental RL 算法。实验验证使用来自文献的数据确认,我们的模型在静态条件下准确地复制了经验 \celeg\ foraging 模式。在动态环境中,持久的信息素轨迹会创建正反馈回路,以致使群体陷入过时选择的锁定状态。通过在多臂老虎机情景中的计算实验,我们揭示了引入少数对信息素不敏感的探索性智能体可恢复集体塑性,实现快速任务切换。这种行为异质性平衡了 exploration-exploitation trade-offs,实现了群体层面对过时策略的灭绝。我们的结果表明,stigmergic 系统本质上编码了分布式 RL 过程,其中环境信号作为集体信用分配的外部记忆。通过将合成生物学与群体机器人学相结合,本工作推动了具备在波动环境中韧性决策能力的可编程生命系统的发展。
引用
@article{arxiv.2509.20095,
title = {From Pheromones to Policies: Reinforcement Learning for Engineered Biological Swarms},
author = {Aymeric Vellinger and Nemanja Antonic and Elio Tuci},
journal= {arXiv preprint arXiv:2509.20095},
year = {2025}
}
备注
Contribution to the 9th International Symposium on Swarm Behavior and Bio-Inspired Robotics 2025