Liputan6:面向文本摘要的大规模印尼语数据集
计算与语言
2020-11-03 v1
摘要
本文介绍一个大规模印尼语摘要数据集。我们从在线新闻门户Liputan6.com采集文章,获得215,827个文档-摘要对。我们利用预训练语言模型,基于多语与单语BERT类模型在该数据集上建立抽取式与生成式摘要的基准方法。我们通过考察ROUGE分数低的机器生成摘要给出细致的错误分析,揭示了ROUGE自身以及抽取式与生成式摘要模型存在的问题。
引用
@article{arxiv.2011.00679,
title = {Liputan6: A Large-scale Indonesian Dataset for Text Summarization},
author = {Fajri Koto and Jey Han Lau and Timothy Baldwin},
journal= {arXiv preprint arXiv:2011.00679},
year = {2020}
}
备注
Accepted at AACL-IJCNLP 2020