中文

基于命名实体的捷克语新闻文章文本摘要

计算与语言 2021-04-22 v1 人工智能 机器学习

摘要

捷克语摘要研究的基础由Straka等人(2018)的工作奠定。他们发布了SumeCzech,一个大型捷克语新闻摘要数据集,并提出了若干基线方法。然而,从所得结果可见仍有很大改进空间。在我们的工作中,我们关注命名实体对捷克语新闻文章摘要的影响。首先,我们为SumeCzech标注命名实体。我们提出新指标ROUGE_NE,用于衡量真实摘要与生成摘要之间命名实体的重叠度,并表明摘要系统在该指标上取得高分仍具挑战性。我们提出一种抽取式摘要方法Named Entity Density,其选择实体数与句子长度之比最高的句子作为文章摘要。实验表明,该方法在新闻文章领域取得了接近以首句作为摘要的稳健基线的结果。此外,我们证明所选句子简洁地反映了报道风格,明确了何人、何时、何地及发生了什么。我们提出此类摘要在与语音应用中呈现新闻文章的首句结合时是有益的。我们提出两种基于Seq2Seq架构的抽象式摘要方法。第一种使用文章的词元;第二种可访问命名实体标注。实验显示两种方法均超越了Straka等人(2018)先前报道的SOTA结果,其中后者在SumeCzech的域外测试集上取得了略优的结果。

关键词

引用

@article{arxiv.2104.10454,
  title  = {Text Summarization of Czech News Articles Using Named Entities},
  author = {Petr Marek and Štěpán Müller and Jakub Konrád and Petr Lorenc and Jan Pichl and Jan Šedivý},
  journal= {arXiv preprint arXiv:2104.10454},
  year   = {2021}
}