IndoSum:面向印尼语文本摘要的新基准数据集
计算与语言
2019-03-21 v5
摘要
自动文本摘要在 NLP 界普遍被认为是一项具有挑战性的任务。其挑战之一在于公开可用的大规模数据集相对稀少且难以构建。对于印尼语等低资源语言,这一问题更为严重。本文提出 IndoSum,一个面向印尼语文本摘要的新基准数据集。该数据集由新闻文章与人工撰写的摘要组成。值得注意的是,其规模约为同领域先前印尼语摘要数据集的 200 倍。我们评估了多种抽取式摘要方法,并获得了令人鼓舞的结果,证明了该数据集的实用性,并为未来研究提供了基线。代码与数据集均以宽松许可证在线发布。
引用
@article{arxiv.1810.05334,
title = {IndoSum: A New Benchmark Dataset for Indonesian Text Summarization},
author = {Kemal Kurniawan and Samuel Louvan},
journal= {arXiv preprint arXiv:1810.05334},
year = {2019}
}
备注
Accepted in IALP 2018