少即是多!一种用于最优语言翻译的精简架构
计算与语言
2023-05-19 v1 人工智能
摘要
softmax 注意力机制作为基于 Transformer 架构成功经验的显著进展,已成为人工智能研究领域的瞩目发展。然而,其不断增长的规模需要越来越多的计算内存,限制了其使用。我们提出 KgV,一种 sigmoid 门控机制,它与 softmax 注意力结合,在不增加架构规模的情况下显著提升性能。为修正规模需求,我们利用张量链(Tensor Chains)识别并剪枝冗余参数。我们发现此类冗余主要存在于嵌入层,而非输出线性层。为进一步提升嵌入并显著减少参数,我们引入 H-SoftPOS,一种分层嵌入层,可同时增强性能。值得注意的是,在 WMT14 英德验证集上,我们的方法在将参数数量也减少 3 倍的同时,将困惑度降低为原来的三分之一,超越了当前最先进(state-of-the-art)水平。当我们进一步将参数数量减少至多七倍时,相对于基线 Transformer 仍可实现困惑度降低 21%。为理解泛化能力,我们在 WMT17 数据集的 7 个语言对上进行了实验。我们的方法在测试损失上优于现有技术,同时将参数数量减半。此外,我们观察到相对于先前最先进水平的方差减少了 70 倍。总之,我们提出的方法在性能和更低内存成本上均带来显著改进。我们将所得架构称为 Anthe。
引用
@article{arxiv.2305.10991,
title = {Less is More! A slim architecture for optimal language translation},
author = {Luca Herranz-Celotti and Ermal Rrapaj},
journal= {arXiv preprint arXiv:2305.10991},
year = {2023}
}