状态空间模型在机器翻译中的有效性
计算与语言
2024-07-09 v1
摘要
Transformer 是 NLP 的当前首选架构,但其注意力层在处理长序列时扩展性不佳。最近的研究提出用线性循环层取代注意力机制,这是状态空间模型所采用的方法,后者在训练和推理方面具有高效优势。然而,这些模型在机器翻译(MT)中是否与 Transformer 具竞争力尚不明确。本文提供了 Transformer 与线性循环模型在 MT 上的严格且全面的实验比较。具体而言,我们实验了 RetNet、Mamba 以及采用注意力机制的 Mamba 的混合版本。我们的发现表明,Mamba 在句子和段落级别的数据上与 Transformer 高度具竞争力,其中在后者两个模型从训练分布中转向更长序列时都受益。进一步分析显示,将注意力集成到 Mamba 中可提高翻译质量、对序列长度外推的鲁棒性,以及对命名实体的记忆能力。
引用
@article{arxiv.2407.05489,
title = {How Effective are State Space Models for Machine Translation?},
author = {Hugo Pitorro and Pavlo Vasylenko and Marcos Treviso and André F. T. Martins},
journal= {arXiv preprint arXiv:2407.05489},
year = {2024}
}