在进化之光下阐明强化学习的三个教条
人工智能
2025-07-30 v3
摘要
强化学习(RL)的三个核心原则——关于智能体的定义、学习的目标以及奖励假设的范围——已被强调为概念修订的关键目标,对理论和应用具有重大影响。我们提出了一个受开放式进化理论启发的框架,以重新考虑这三个“教条”。我们重新审视了每个假设,并解决了随之提出的相关问题。为了使我们的论点与 RL 作为生物学习模型相关,我们首先确定进化动力学可以在个体一生中合理地发生在活体大脑内,而不仅限于跨代过程。我们首先重新审视第二个教条,借鉴进化见解来丰富“适应而非搜索”的学习观。然后,我们处理关于奖励假设局限性的第三个教条,使用进化适应度的类比来阐明标量奖励与多目标之争。在讨论了 RL 中探索的实际意义之后,我们转向第一个——也可以说是最根本的——问题:缺乏对智能体的形式化描述。我们认为,与其他两个问题不同,仅靠进化范式无法解决智能体问题,尽管它指向了一个富有成效的方向。我们主张整合生命起源理论中的思想,其中维持和复制的热力学为理解生物系统中的智能体和资源受限的强化学习提供了有前景的基础。
引用
@article{arxiv.2507.11482,
title = {Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light},
author = {Mani Hamidi and Terrence W. Deacon},
journal= {arXiv preprint arXiv:2507.11482},
year = {2025}
}