中文

基于记忆体的循环强化学习

机器学习 2024-10-29 v3 人工智能

摘要

诸如循环神经网络和Transformer等记忆模型通过将轨迹映射到潜在马尔可夫状态来处理部分可观测马尔可夫决策过程。这两种模型在长序列上的扩展性都不太好,尤其是与一类新兴的记忆模型——线性循环模型相比。我们发现这些模型的循环更新类似于一个幺半群,从而促使我们使用一种称为记忆体的新颖幺半群框架来重新表述现有模型。我们重新审视了循环强化学习中传统的批处理方法,指出了其理论和经验上的缺陷。我们利用记忆体提出了一种批处理方法,该方法提高了样本效率,增加了回报,并简化了强化学习中循环损失函数的实现。

关键词

引用

@article{arxiv.2402.09900,
  title  = {Recurrent Reinforcement Learning with Memoroids},
  author = {Steven Morad and Chris Lu and Ryan Kortvelesy and Stephan Liwicki and Jakob Foerster and Amanda Prorok},
  journal= {arXiv preprint arXiv:2402.09900},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024