基于合成数据预训练的交错文本摘要模型少样本学习
计算与语言
2021-03-10 v1
摘要
交错文本(即属于不同线程的帖子依次出现)常见于在线聊天记录中,因此快速获取讨论概览往往耗时费力。现有系统先按线程解开帖子,再从这些线程中提取摘要。此类系统的一个主要问题来自解缠组件的误差传播。虽然端到端可训练的摘要系统可免去显式解缠,但这类系统需要大量标注数据。为此,我们提出使用合成交错文本预训练一个端到端可训练的层次化编码器-解码器系统。我们表明,通过在真实会议数据集(AMI)上微调,此类系统比传统两步系统高出22%。我们还与transformer模型进行比较,观察到使用合成数据预训练编码器与解码器均优于仅在大语料上预训练编码器的BertSumExtAbs transformer模型。
引用
@article{arxiv.2103.05131,
title = {Few-Shot Learning of an Interleaved Text Summarization Model by Pretraining with Synthetic Data},
author = {Sanjeev Kumar Karn and Francine Chen and Yan-Ying Chen and Ulli Waltinger and Hinrich Schuetze},
journal= {arXiv preprint arXiv:2103.05131},
year = {2021}
}
备注
Adapt-NLP: The Second Workshop on Domain Adaptation for NLP