中文

基于迹单元的实时循环学习

机器学习 2024-10-31 v2 人工智能

摘要

循环神经网络 (RNN) 用于学习部分可观测环境中的表征。对于在线学习并持续与环境交互的智能体,采用实时循环学习 (RTRL) 来训练 RNN 是理想方式;然而,RTRL 对标准 RNN 代价极高。一个有前景的方向是使用线性循环架构 (LRU),其中将稠密循环权重替换为复值对角矩阵,从而使 RTRL 高效。在本工作中,我们在这些见解基础上,提供一种轻量且有效的在线强化学习中训练 RNN 的方法。我们引入循环迹单元 (RTU),这是一种对 LRU 的小修改,但我们发现使用 RTRL 训练时,RTU 在多个部分可观测环境中相较于 LRU 拥有显著的性能优势。我们发现 RTU 在使用显著更少计算资源的情况下,显著优于其他循环架构。

关键词

引用

@article{arxiv.2409.01449,
  title  = {Real-Time Recurrent Learning using Trace Units in Reinforcement Learning},
  author = {Esraa Elelimy and Adam White and Michael Bowling and Martha White},
  journal= {arXiv preprint arXiv:2409.01449},
  year   = {2024}
}

备注

Neurips 2024