我们真的只需要 RNN 吗?
机器学习
2024-12-02 v3 人工智能
摘要
2017 年 Transformer 的引入彻底改变了深度学习的格局。该模型最初提出用于序列建模,随后在各个领域取得了广泛成功。然而,Transformer 在序列长度方面的可扩展性限制——尤其是与序列长度相关的限制——又催生了对新型循环模型的重新关注,这些模型在训练时可并行化、性能与 Transformer 相当且更具可扩展性。在本工作中,我们从历史视角重新审视序列建模,聚焦于在 Transformer 兴起前已主导该领域两十余年的循环神经网络 (RNN)。具体而言,我们考察 LSTM (1997) 和 GRU (2014)。我们证明,通过简化这些模型,可导出最小版本 (minLSTM 和 minGRU),其 (1) 参数数量少于传统版本, (2) 在训练时完全可并行化, (3) 在多项任务上实现令人惊讶的竞争性能,甚至与最新模型如 Transformer 持水平。
引用
@article{arxiv.2410.01201,
title = {Were RNNs All We Needed?},
author = {Leo Feng and Frederick Tung and Mohamed Osama Ahmed and Yoshua Bengio and Hossein Hajimirsadeghi},
journal= {arXiv preprint arXiv:2410.01201},
year = {2024}
}