中文

MeetSum:利用Transformer变革会议转录摘要生成

计算与语言 2021-08-16 v1 机器学习

摘要

由于可用于训练神经网络模型的标注数据有限,从会议转录文本生成抽取式摘要一直具有挑战性。此外,基于Transformer的架构在新闻数据摘要上已证明优于最先进的模型。在本文中,我们利用基于Transformer的指针生成网络来生成会议转录文本的抽象摘要。该模型使用2个LSTM作为编码器和解码器、一个从输入文本复制词语的指针网络,以及一个生成集外词的生成网络(从而使摘要具有抽象性)。此外,使用覆盖机制以避免生成摘要中的词语重复。首先,我们表明在新闻摘要数据集上训练模型并使用零样本学习在会议数据集上测试,比在AMI会议数据集上训练产生更好的结果。其次,我们表明先在CNN-Dailymail等域外数据集上训练该模型,然后在AMI会议数据集上微调,能够显著提升模型性能。我们在AMI数据集的测试集上测试模型,并报告生成摘要的ROUGE-2分数以与已有文献比较。我们还报告了摘要的Factual分数,由于ROUGE-2分数仅限于衡量词重叠,它是抽象摘要更好的基准。我们表明改进模型在ROUGE-2分数上至少比先前模型提升5分,这是一个实质性改进。此外,对我们模型生成摘要的定性分析表明,这些摘要具有人类可读性,且确实捕获了转录文本中大部分重要信息。

关键词

引用

@article{arxiv.2108.06310,
  title  = {MeetSum: Transforming Meeting Transcript Summarization using Transformers!},
  author = {Nima Sadri and Bohan Zhang and Bihan Liu},
  journal= {arXiv preprint arXiv:2108.06310},
  year   = {2021}
}