中文

GeSERA:基于相关性分析的通领域摘要评测方法

计算与语言 2021-10-08 v1 信息检索

摘要

我们提出 GeSERA,这是 SERA 的改进开源版本,用于评测通领域的自动抽取式与生成式摘要。SERA 基于一个搜索引擎,将候选摘要与参考摘要(称为查询)与信息检索文档库(称为索引)进行比较。SERA 最初仅针对生物医学领域设计,在该领域其与人评方法的相关性优于广泛使用的基于词法的 ROUGE 方法。在本文中,我们通过将其基于内容的方法进行适配,使 SERA 脱离生物医学领域进入通领域,从而成功评测通领域摘要。首先,我们利用通领域语料的词性标注(POS Tags)分析改进查询重构策略。其次,我们将 SERA 中使用的生物医学索引替换为来自 AQUAINT-2 和 Wikipedia 的两类文章集合。我们使用 TAC2008、TAC2009 和 CNNDM 数据集进行实验。结果表明,在大多数情况下,GeSERA 与人评方法的相关性高于 SERA,同时缩小了其与 ROUGE 在通领域摘要评测上的差距。GeSERA 在 TAC2009 的两个案例中甚至超越了 ROUGE。最后,我们进行了大量实验,并全面研究了人工标注者以及索引规模对使用 SERA 与 GeSERA 进行摘要评测的影响。

关键词

引用

@article{arxiv.2110.03567,
  title  = {GeSERA: General-domain Summary Evaluation by Relevance Analysis},
  author = {Jessica López Espejel and Gaël de Chalendar and Jorge Garcia Flores and Thierry Charnois and Ivan Vladimir Meza Ruiz},
  journal= {arXiv preprint arXiv:2110.03567},
  year   = {2021}
}

备注

Accepted in RANLP 2021 conference