BANG:通过大规模预训练桥接自回归与非自回归生成
计算与语言
2021-06-17 v3
摘要
本文中,我们提出 BANG,一种用于桥接自回归(AR)与非自回归(NAR)生成之间鸿沟的新预训练模型。AR 与 NAR 生成可统一视为先前 token 可被关注的程度,BANG 通过设计一种用于大规模预训练的新模型结构来桥接 AR 与 NAR 生成。预训练的 BANG 模型可同时支持 AR、NAR 与半 NAR 生成以满足不同需求。在问题生成(SQuAD 1.1)、摘要(XSum)与对话生成(PersonaChat)上的实验表明,BANG 显著提升了 NAR 与半 NAR 性能,同时取得了与强 AR 预训练模型相当的性能。相较于半 NAR 强基线,BANG 在 SQuAD 1.1 与 XSum 的总体分数上分别取得 14.01 与 5.24 的绝对提升。此外,相较于强 NAR 基线,BANG 在 SQuAD、XSUM 与 PersonaChat 的总体分数上分别取得 10.73、6.39 与 5.90 的绝对提升。
引用
@article{arxiv.2012.15525,
title = {BANG: Bridging Autoregressive and Non-autoregressive Generation with Large Scale Pretraining},
author = {Weizhen Qi and Yeyun Gong and Jian Jiao and Yu Yan and Weizhu Chen and Dayiheng Liu and Kewen Tang and Houqiang Li and Jiusheng Chen and Ruofei Zhang and Ming Zhou and Nan Duan},
journal= {arXiv preprint arXiv:2012.15525},
year = {2021}
}
备注
Accepted by ICML 2021