中文

孟加拉语文本文档的无监督抽取式摘要

计算与语言 2021-02-22 v2

摘要

抽取式摘要系统通常依赖大量文档-摘要平行语料。然而,由于孟加拉语等低资源语言缺乏平行数据,抽取式系统的性能仍具挑战。为克服该问题,我们提出一种基于图的无监督抽取式摘要系统,面向孟加拉语文本文档的单文档场景,仅需一个词性(POS)标注器和一个在孟加拉语文本上预训练的语言模型。我们还提供了一份带文档-摘要对的人工标注数据集,用于评估我们的抽取式模型并支持未来孟加拉语抽取式摘要系统的比较。我们在该数据集上开展实验,并将我们的系统与若干成熟的无监督抽取式摘要系统比较。我们的无监督抽取式摘要模型在未接触任何人工标注参考摘要的情况下优于基线方法。

关键词

引用

@article{arxiv.2102.04490,
  title  = {Unsupervised Abstractive Summarization of Bengali Text Documents},
  author = {Radia Rayan Chowdhury and Mir Tafseer Nayeem and Tahsin Tasnim Mim and Md. Saifur Rahman Chowdhury and Taufiqul Jannat},
  journal= {arXiv preprint arXiv:2102.04490},
  year   = {2021}
}

备注

EACL 2021