中文

世界模型解锁强化学习智能体的最优觅食策略

人工智能 2025-12-30 v2 机器学习

摘要

觅食补両涉及确定最佳时机离开资源丰富的区域并探查potentially更有利的替代方案的过程。边际价值定理 (MVT) 常用于表征这一过程,为此类觅食行为提供了最优模型。尽管该模型已广泛用于行为生态学中的预测,但发现生物觅食者如何计算机制促进最优补両觅食决策的出现仍在探索中。本文显示,配备学习世界模型的人工觅食者自然收敛于 MVT 对齐的策略。我们使用一种获取其环境精简预测表示的基于模型的强化学习智能体,演示了Anticipatory capabilities(而非仅仅奖励最大化)驱动高效补両离开行为。与标准模型无关 RL 智能体相比,这些基于模型的智能体展现出类似许多生物学同类反应的决策模式,这表明预测世界模型可作为更具解释性和生物学基础决策的AI系统的基础。总体而言,我们的发现凸显了生态学最优原则在推进可解释和自适应AI方面的价值。

关键词

引用

@article{arxiv.2512.12548,
  title  = {World Models Unlock Optimal Foraging Strategies in Reinforcement Learning Agents},
  author = {Yesid Fonseca and Manuel S. Ríos and Nicanor Quijano and Luis F. Giraldo},
  journal= {arXiv preprint arXiv:2512.12548},
  year   = {2025}
}

备注

14 pages, 6 figures