中文

强化学习中迭代计算的作用

机器学习 2026-02-18 v2

摘要

强化学习 (RL) 策略可获得的计算量如何影响其学习?参数数量固定的策略还能从额外的计算中受益吗?标准的 RL 框架没有提供正式回答这些问题的语言。经验上,深度 RL 策略通常被参数化为具有静态架构的神经网络,将计算量和参数数量混为一谈。在本文中,我们形式化了计算受限的策略,并证明了使用更多计算的策略可以解决标准 feedforward 网络或深度残余网络(后者参数数量最高可达 5 倍)无法解决的问题,并能够更好地泛化到更长时程任务。基于先前在算法学习和无模型规划方面的工作,我们提出了一种最小化架构,可使用可变计算量。我们的实验补充了我们的理论。在 31 个不同任务上(涵盖在线和离线 RL),我们显示 (1)(1) 这种架构仅通过使用更多计算就实现了更强的性能,(2)(2) 在更长时程测试任务上的更强泛化能力优于标准 feedforward 网络或深度残余网络。

关键词

引用

@article{arxiv.2602.05999,
  title  = {On the Role of Iterative Computation in Reinforcement Learning},
  author = {Raj Ghugare and Michał Bortkiewicz and Alicja Ziarko and Benjamin Eysenbach},
  journal= {arXiv preprint arXiv:2602.05999},
  year   = {2026}
}