稀疏通用Transformer
计算与语言
2023-10-12 v1 人工智能
摘要
通用Transformer(UT)是Transformer的一种变体,其在各层之间共享参数。经验证据表明,在形式语言任务中,UT比原始Transformer(VT)具有更好的组合泛化能力。参数共享也使其比VT具有更好的参数效率。尽管有诸多优势,扩展UT参数比扩展VT在计算和内存上密集得多。本文提出稀疏通用Transformer(SUT),其利用稀疏专家混合(SMoE)和一种新的基于stick-breaking的动态停止机制,在保持UT参数效率与泛化能力的同时降低其计算复杂度。实验表明,在WMT'14上SUT仅使用一半的计算与参数即取得与强基线模型相同的性能,并在形式语言任务(逻辑推理与CFQ)上展现出强泛化结果。新的停止机制还可在推理时减少约50%的计算量,且在形式语言任务上性能下降极小。
引用
@article{arxiv.2310.07096,
title = {Sparse Universal Transformer},
author = {Shawn Tan and Yikang Shen and Zhenfang Chen and Aaron Courville and Chuang Gan},
journal= {arXiv preprint arXiv:2310.07096},
year = {2023}
}