受昆虫启发的模块化架构作为强化学习的归纳偏置
机器学习
2026-04-27 v1 计算物理
摘要
用于连续控制的大多数强化学习控制器在架构上是集中式的:观测被压缩成一个单一的潜在状态,从中同时产生价值估计和动作。生物控制系统通常以不同的方式组织。特别是昆虫,通过分布式电路而非单一的整体控制器来协调导航、航向稳定、记忆和上下文相关的动作选择。受此对比启发,我们研究了一种强化学习策略架构,该架构将控制分解为用于感觉编码、航向表示、稀疏联想记忆、循环命令生成和局部运动控制的交互模块,并带有一个学习到的仲裁机制,用于在模块间分配运动权限。该模型在一个需要同时进行觅食、避障和躲避捕食者的二维导航任务上进行了评估。在一个使用近端策略优化训练75次更新的六种子捕食者导航实验中,模块化策略在测试的控制器中取得了最强的最终平均性能,最终回合回报为,而集中式门控循环单元为,集中式多层感知机为。模块化策略还实现了最低的最终价值损失和稳定的PPO优化统计量,同时将模块分配熵驱动至,表明高度选择性的控制分配。这些结果表明,对于涉及动态竞争行为目标的强化学习问题,分布式控制可以作为一种有用的归纳偏置。
引用
@article{arxiv.2604.22081,
title = {Insect-inspired modular architectures as inductive biases for reinforcement learning},
author = {Anne E. Staples},
journal= {arXiv preprint arXiv:2604.22081},
year = {2026}
}