UT5:通过展开去噪预训练非自回归 T5
计算与语言
2023-11-16 v1
摘要
基于 Transformer 的大语言模型(LLM)近期在自然语言生成方面取得了重大进展。然而,要解码 K 个词元,自回归模型需要 K 次顺序前向传播,这可能成为大语言模型的性能瓶颈。许多非自回归(NAR)研究旨在解决这一顺序性瓶颈,尽管其中许多聚焦于有监督基准中的专用架构。在本工作中,我们通过展开去噪研究了非自回归 T5 模型的无监督预训练,并展示了其在 SQuAD 问题生成和 XSum 等下游生成任务中的 SOTA 结果。
引用
@article{arxiv.2311.08552,
title = {UT5: Pretraining Non autoregressive T5 with unrolled denoising},
author = {Mahmoud G. Salem and Jiayu Ye and Chu-Cheng Lin and Frederick Liu},
journal= {arXiv preprint arXiv:2311.08552},
year = {2023}
}