生物层次性强化学习中的贴现与药物寻求
神经元与认知
2025-06-06 v1
摘要
尽管个体渴望戒除长期物质使用障碍(SUD),但他们往往难以抵抗药物使用,即使意识到其有害后果也是如此。这一知识与强迫行为之间的断裂反映了成瘾中根本性的认知行为冲突。神经生物学上,迷走核亚区域内的差异性线索诱导活性,以及多巴胺介导的从前额束到后肢神经通路的连接,导致强迫性药物寻求。然而,将这些发现与行为冲突功能机制相联系的机制尚不清楚。成瘾的另一标志是时间贴现:药物依赖者的贴现率比非使用者更陡峭。假设前额束-后肢神经组织反映从认知到运动表征的梯度,成瘾可在层次化强化学习(HRL)框架中建模。然而,将贴现整合到生物学依据的HRL中仍是一个开放性挑战。在本研究中,我们在显示动作选择因药物奖励而变得不敏感于随后的负面后果的模型基础上进行了构建。通过确保所有HRL层次的自然奖励值收敛,同时由于其多巴胺效应导致药物奖励发生偏离,我们解决了将贴现整合到HRL中的问题。我们的结果表明,高贴现放大了整个层次结构中的药物寻求,将更快的贴现与增加的成瘾严重性和冲动性相关联。我们展示了与时间贴现实证发现的一致性,并提出可测试的预测,确立成瘾作为层次决策障碍。
引用
@article{arxiv.2506.04549,
title = {Discounting and Drug Seeking in Biological Hierarchical Reinforcement Learning},
author = {Vardhan Palod and Pranav Mahajan and Veeky Baths and Boris S. Gutkin},
journal= {arXiv preprint arXiv:2506.04549},
year = {2025}
}
备注
Accepted in the Proceedings of Cognitive Computational Neuroscience (CCN) 2025