ProphetNet:面向序列到序列预训练的未来 N-gram 预测
计算与语言
2020-10-22 v3
摘要
本文提出一种新的序列到序列预训练模型 ProphetNet,其引入了一种名为未来 n-gram 预测的新颖自监督目标以及所提出的 n-stream 自注意力机制。与传统的序列到序列模型优化单步前向预测不同,ProphetNet 通过 n 步前向预测进行优化,即在每个时间步基于先前的上下文词元同时预测接下来的 n 个词元。未来 n-gram 预测显式地鼓励模型对后续词元进行规划,并防止对强局部相关性过拟合。我们分别使用基础规模数据集(16GB)和大规模数据集(160GB)对 ProphetNet 进行预训练。随后我们在 CNN/DailyMail、Gigaword 和 SQuAD 1.1 基准上针对摘要生成和问答生成任务开展实验。实验结果表明,与使用同等规模预训练语料的模型相比,ProphetNet 在所有这些数据集上均取得了新的 SOTA 结果。
引用
@article{arxiv.2001.04063,
title = {ProphetNet: Predicting Future N-gram for Sequence-to-Sequence Pre-training},
author = {Weizhen Qi and Yu Yan and Yeyun Gong and Dayiheng Liu and Nan Duan and Jiusheng Chen and Ruofei Zhang and Ming Zhou},
journal= {arXiv preprint arXiv:2001.04063},
year = {2020}
}
备注
Accepted to EMNLP 2020 Findings. Project page: https://github.com/microsoft/ProphetNet