中文

Retentive Network 研究综述

计算与语言 2025-06-10 v1

摘要

Retentive Network(RetNet)代表了神经网络架构的一个重大进展,为Transformer 提提供了一种高效替代方案。虽然Transformer 依赖于自注意力机制来建模依赖关系,但由于其二次复杂度,处理长序列时会产生高内存开销并受限于可扩展性。为缓解这些限制,RetNet 引入了一种保留机制,将 recurrence 的归纳偏置与注意力的全局依赖建模统一起来。该机制实现了线性时间推理,高效地建模更长的上下文,同时保持与完全可并行训练管道的兼容性。由于其在机器学习范式中持续展示出跨领域的有效性,包括自然语言处理、语音识别和时间序列分析,RetNet 在获得研究人员的广泛关注。然而,当前文献中缺乏对RetNet的综合性综述。本文旨在填补这一空白,通过提供对RetNet架构、其关键创新及其多样化应用的第一手详细调查。我们还探讨了RetNet的主要挑战,并提出了未来研究方向,以支持其在学术研究和实际部署中的持续发展。

关键词

引用

@article{arxiv.2506.06708,
  title  = {A Survey of Retentive Network},
  author = {Haiqi Yang and Zhiyuan Li and Yi Chang and Yuan Wu},
  journal= {arXiv preprint arXiv:2506.06708},
  year   = {2025}
}

备注

15 pages, 3 figures