通过模拟出生与死亡演化奖励:食物与运动行为
神经与进化计算
2024-06-24 v1 人工智能
摘要
奖励系统是动物行为的基本驱动力,对生存与繁衍至关重要。尽管其重要性已明确,但奖励系统如何演化仍是未被充分探讨的议题。本文尝试复制生物学上可信的奖励函数的演化,并探讨环境条件如何影响演化后奖励的形状。为此,我们开发了基于人口的去中心化演化仿真框架,其中代理人维持能量水平以存活更久并生产更多后代。每个代理人从其父代继承奖励函数,同时进行变异,并通过强化学习在其一生中学习获取奖励。我们的结果表明,生物学上合理的正奖励可用于食物获取,负奖励可用于运动行为,这些奖励可从随机初始化的奖励中演化而来。然而,我们也发现运动奖励会演化为两种模式:一种是大量为正,另一种是略为为负。积极的运动奖励的出现令人惊讶,因为它会使代理人过度活跃,降低觅食效率。在食物稀缺和有毒的环境中,针对不重要食物的奖励趋于不稳定,而针对正常食物的奖励仍保持稳定。这些结果表明,我们的仿真环境和能源依赖的出生与死亡模型对进一步研究奖励系统的起源具有有用性。
引用
@article{arxiv.2406.15016,
title = {Evolution of Rewards for Food and Motor Action by Simulating Birth and Death},
author = {Yuji Kanagawa and Kenji Doya},
journal= {arXiv preprint arXiv:2406.15016},
year = {2024}
}