HRM-Agent:使用强化学习在动态环境中训练递归推理模型
人工智能
2025-10-28 v1 机器学习
机器学习
摘要
层次化推理模型(HRM)虽然体积小却展现出惊人的推理能力,但仅应用于监督式、静态且完全可观测的问题。HRM的一个优势在于其能够根据问题难度调整计算资源。然而,当前版本无法在问题动态、不可确定或部分可观测的情况下整合和重用前述时间步的计算,也无法应对正确动作未定义的情形,这些特点是许多实际问题的特征。本文提出HRM-Agent,这是一种仅使用强化学习训练的HRM变体。我们展示HRM能够在动态且不可确定的迷宫环境中学习目标导航。近期研究表明HRM的推理能力源于其递归推理过程。我们探讨了递归推理过程的动力学,发现证据表明它成功地重用了早期环境时间步的计算。
引用
@article{arxiv.2510.22832,
title = {HRM-Agent: Training a recurrent reasoning model in dynamic environments using reinforcement learning},
author = {Long H Dang and David Rawlinson},
journal= {arXiv preprint arXiv:2510.22832},
year = {2025}
}
备注
14 pages, 9 figures, 1 table