中文

近期抽象摘要技术综述

计算与语言 2021-05-04 v1 信息检索 机器学习

摘要

本文综述了几种近期抽象摘要方法:T5、Pegasus和ProphetNet。我们在两种语言中实现了这些系统:英语和印尼语。我们研究了预训练模型(一个T5、三个Pegasus、三个ProphetNet)对英语和印尼语若干Wikipedia数据集的影响,并将结果与Wikipedia系统的摘要进行比较。T5-Large、Pegasus-XSum和ProphetNet-CNNDM提供了最佳摘要。影响ROUGE性能的最显著因素是覆盖度、密度和压缩率。分数越高,摘要越好。影响ROUGE分数的其他因素包括预训练目标、数据集特征、用于测试预训练模型的数据集以及跨语言功能。改进本文局限性的若干建议为:1)确保用于预训练模型的数据集必须足够大,包含充足的实例以处理跨语言目的;2)高级处理(微调)应当合理。我们建议在实施高级处理(如预训练模型训练阶段中零样本翻译的train-infer-train流程)之前,使用由多种语言主题全面覆盖组成的大型数据集。

关键词

引用

@article{arxiv.2105.00824,
  title  = {A Survey of Recent Abstract Summarization Techniques},
  author = {Diyah Puspitaningrum},
  journal= {arXiv preprint arXiv:2105.00824},
  year   = {2021}
}

备注

6 tables, 1 figure, additionals (data): https://drive.google.com/drive/folders/152XMSCU3ctshB2BvzEQHY0vo6xkZ9gOl?usp=sharing , https://drive.google.com/drive/folders/1z09D2-4arE6aOQZxgxcwMVF41xMH4EEH?usp=sharing. Awaiting at https://www.springer.com/gp/book/9789811621017