中文

ED-FAITH:面向对话摘要忠实性的评估方法

计算与语言 2022-11-17 v1

摘要

抽取式摘要模型通常会生成与输入不忠实的内容,这凸显了评估生成摘要忠实性的重要意义。大多数忠实性度量仅在新闻领域上进行了评估,它们能否迁移到其他摘要任务?在本工作中,我们首先对对话摘要的忠实性度量进行了系统性研究。我们在对话数据集上评估了常见的忠实性度量,并观察到尽管这些度量在新闻数据集上表现良好,但它们与人工判断的相关性很差。基于这些发现,为提升现有度量在对话摘要上的表现,我们首先在领域内数据集上进行微调,随后对负样本应用非似然训练(unlikelihood training),结果表明它们能够成功改善度量在对话数据上的性能。受 T0 语言模型强大的零样本性能启发,我们进一步提出了 T0-Score——一种用于忠实性评估的新度量,其在多个领域相较基线度量均展现出一致的改进。

关键词

引用

@article{arxiv.2211.08464,
  title  = {ED-FAITH: Evaluating Dialogue Summarization on Faithfulness},
  author = {Sicong Huang and Asli Celikyilmaz and Haoran Li},
  journal= {arXiv preprint arXiv:2211.08464},
  year   = {2022}
}