中文

受昆虫启发的模块化架构作为强化学习的归纳偏置

机器学习 2026-04-27 v1 计算物理

摘要

用于连续控制的大多数强化学习控制器在架构上是集中式的:观测被压缩成一个单一的潜在状态,从中同时产生价值估计和动作。生物控制系统通常以不同的方式组织。特别是昆虫,通过分布式电路而非单一的整体控制器来协调导航、航向稳定、记忆和上下文相关的动作选择。受此对比启发,我们研究了一种强化学习策略架构,该架构将控制分解为用于感觉编码、航向表示、稀疏联想记忆、循环命令生成和局部运动控制的交互模块,并带有一个学习到的仲裁机制,用于在模块间分配运动权限。该模型在一个需要同时进行觅食、避障和躲避捕食者的二维导航任务上进行了评估。在一个使用近端策略优化训练75次更新的六种子捕食者导航实验中,模块化策略在测试的控制器中取得了最强的最终平均性能,最终回合回报为2798.8±964.4-2798.8\pm964.4,而集中式门控循环单元为3778.0±628.1-3778.0\pm628.1,集中式多层感知机为4727.5±772.5-4727.5\pm772.5。模块化策略还实现了最低的最终价值损失和稳定的PPO优化统计量,同时将模块分配熵驱动至0.0457±0.02440.0457\pm0.0244,表明高度选择性的控制分配。这些结果表明,对于涉及动态竞争行为目标的强化学习问题,分布式控制可以作为一种有用的归纳偏置。

关键词

引用

@article{arxiv.2604.22081,
  title  = {Insect-inspired modular architectures as inductive biases for reinforcement learning},
  author = {Anne E. Staples},
  journal= {arXiv preprint arXiv:2604.22081},
  year   = {2026}
}