中文

DiscoScore:基于 BERT 与语篇连贯性评估文本生成

计算与语言 2023-02-07 v4

摘要

近来,从语篇连贯性视角设计文本生成系统(例如建模句子间的相互依赖)的兴趣日益增长。然而,近期基于 BERT 的评测指标在识别连贯性方面表现薄弱,因而无法可靠地发现那些文本生成系统在语篇层面的改进。本工作中,我们提出 DiscoScore,一种参数化语篇指标,它利用 BERT 在中心理论(Centering theory)驱动下从多种视角建模语篇连贯性。我们的实验涵盖 16 种非语篇与语篇指标,包括 DiscoScore 和流行的连贯性模型,在摘要和文档级机器翻译(MT)上进行了评测。我们发现:(i)大多数基于 BERT 的指标与人类评定的连贯性之间的相关性,远差于十年前提出的早期语篇指标;(ii)近期最先进的 BARTScore 在系统层级使用时表现薄弱——而系统通常以这种方式进行比较,这尤其成问题。相比之下,DiscoScore 在与人类评分的系统层级相关性上表现强劲,不仅在连贯性上,也在事实一致性和其他方面,并在平均上以超过 10 个相关点超越 BARTScore。此外,为理解 DiscoScore,我们论证了语篇连贯性对评测指标的重要性,并解释了一种变体优于另一种的原因。我们的代码见 \url{https://github.com/AIPHES/DiscoScore}。

关键词

引用

@article{arxiv.2201.11176,
  title  = {DiscoScore: Evaluating Text Generation with BERT and Discourse Coherence},
  author = {Wei Zhao and Michael Strube and Steffen Eger},
  journal= {arXiv preprint arXiv:2201.11176},
  year   = {2023}
}

备注

EACL2023 Camera Ready