使用单一预训练 Transformer 实现样本高效文本摘要
计算与语言
2019-05-23 v1
摘要
语言模型(LM)预训练已在多种语言理解任务上带来令人印象深刻的性能与样本效率。然而,如何最好地将预训练 LM 用于如抽象式摘要等生成任务,尤其是提升样本效率,仍不明确。在这些序列到序列设定中,已有工作尝试将预训练权重载入编码器及/或解码器网络,但使用了非预训练的编码器-解码器注意力权重。我们改用预训练的唯一解码器网络,其中同一个 Transformer LM 既编码源文本又生成摘要。这确保了网络中包括掌控对源状态注意力的所有参数,在微调步骤前均已被预训练。在 CNN/Daily Mail 数据集上的实验表明,在有限数据设定下,我们的预训练 Transformer LM 相较预训练的 Transformer 编码器-解码器网络有实质性提升。例如,其仅使用 1% 的训练数据(约3000例)即取得 13.1 ROUGE-2,而预训练编码器-解码器模型得分为 2.3 ROUGE-2。
引用
@article{arxiv.1905.08836,
title = {Sample Efficient Text Summarization Using a Single Pre-Trained Transformer},
author = {Urvashi Khandelwal and Kevin Clark and Dan Jurafsky and Lukasz Kaiser},
journal= {arXiv preprint arXiv:1905.08836},
year = {2019}
}