在玩 Sokoban 的循环神经网络中进行规划
机器学习
2025-06-02 v3 人工智能
摘要
规划是解决复杂任务的关键,但神经网络内部背后的规划机制仍不完全了解。基于先前的工作,我们分析了一个在 Sokoban 上训练的循环神经网络(RNN),Sokoban 是一个需要顺序、不可逆决策的具有挑战性的谜题。我们发现该 RNN 具有一个因果计划表示,能够预测其未来约 50 步的行动。计划的质量和长度在前几步中会增加。我们揭示了一个令人惊讶的行为:RNN 在循环中“踱步”,为在关卡开始时提供额外的计算资源,并显示该行为是由训练激励的。利用这些见解,我们将训练好的 RNN 扩展到更大的、超出训练范围的 Sokoban 谜题,展示了超出训练范畴的稳健表示。我们开源了该模型和代码,认为该神经网络的有趣行为使其成为深化我们对学习规划理解的优秀模型生物。
引用
@article{arxiv.2407.15421,
title = {Planning in a recurrent neural network that plays Sokoban},
author = {Mohammad Taufeeque and Philip Quirke and Maximilian Li and Chris Cundy and Aaron David Tucker and Adam Gleave and Adrià Garriga-Alonso},
journal= {arXiv preprint arXiv:2407.15421},
year = {2025}
}
备注
Mechanistic Interpretability workshop, ICML 2024