利用自监督学习与反向摘要挖掘无标注数据用于抽取式语音摘要
计算与语言
2020-09-18 v2
摘要
神经抽取式摘要的监督方法需要大量标注语料,而构建这些语料代价高昂。我们提出一项法语会议摘要任务,该任务基于会议音频录音的自动转写文本来预测会议报告。为构建该任务的语料,需获取每次会议的(自动或人工)转写文本,并将其分割、与对应人工报告对齐,以生成适合训练的训练样本。另一方面,我们拥有海量未对齐数据,尤其是无对应转写文本的报告。报告由专业人员撰写且格式规范,预处理十分简便。在此背景下,我们研究如何利用这两类方法挖掘该海量未对齐数据的价值:(i)使用目标端去噪编码器-解码器模型进行自监督预训练;(ii)反向摘要,即通过给定报告学习预测转写文本来逆转摘要过程,从而将单篇报告与生成的转写文本对齐,并将该合成数据集用于进一步训练。我们在两个评测集上报告了相较先前仅基于对齐数据训练的基线方法的显著提升。此外,将两种方法结合效果更优,在两个评测集上以 +6 ROUGE-1 与 ROUGE-L 以及 +5 ROUGE-2 的大幅优势超越基线。
引用
@article{arxiv.2007.15296,
title = {Leverage Unlabeled Data for Abstractive Speech Summarization with Self-Supervised Learning and Back-Summarization},
author = {Paul Tardy and Louis de Seynes and François Hernandez and Vincent Nguyen and David Janiszek and Yannick Estève},
journal= {arXiv preprint arXiv:2007.15296},
year = {2020}
}
备注
To be published in Proceedings of SPECOM 2020