基于非平稳 K-臂臂 bandit 问题的生物仿真最小模型
神经元与认知
2025-09-29 v1
摘要
虽然强化学习算法在解决多臂 bandit 问题方面取得了显著进展,但它们在架构和动力学上常常缺乏生物学可行性。本文提出了一个基于相互作用的速率神经元群的生物仿生神经模型,灵感来自轨道前额叶皮层和前扣带皮层。我们的模型在各种随机 bandit 问题中表现出稳健的性能,匹配了标准算法如 Thompson 抽样和 UCB 的效果。值得注意的是,该模型 exhibits 自适应行为:在低不确定性情境下采用贪婪策略,而在不确定性升高时增加探索行为。通过进化优化,我们发现模型的超参数收敛到与已知突触机制相一致的值,特别是在突触依赖神经活动和学习率适应方面。这一发现表明,生物学启发的计算架构能够实现具有竞争力的性能,同时为理解不确定性下决策机制的神经学机制提供了见解。
引用
@article{arxiv.2509.22209,
title = {A Bio-Inspired Minimal Model for Non-Stationary K-Armed Bandits},
author = {Krubeal Danieli and Mikkel Elle Lepperød},
journal= {arXiv preprint arXiv:2509.22209},
year = {2025}
}
备注
Submitted to review, not yet accepted