中文

ChatGPT 作为文本摘要的事实不一致性评估器

计算与语言 2023-04-14 v2

摘要

预训练语言模型极大地提升了文本摘要的性能。现有方法的一个主要问题是,大多数生成的摘要与其源文档在事实上并不一致。为缓解该问题,许多研究致力于基于自然语言推理、问答和句法依赖等开发有效的事实性评估指标。然而,这些方法受限于其高计算复杂度或多组件流水线引入的不确定性,导致仅与人工判断部分一致。最近,大语言模型(LLM)不仅在文本生成而且在语言理解方面都展现出优异性能。在本文中,我们特别探索了 ChatGPT 在零样本设定下评估事实不一致性的能力,通过在粗粒度和细粒度评估任务(包括二元蕴含推理、摘要排序和一致性评分)上对其进行检验。实验结果表明,ChatGPT 在三项任务上总体优于以往的评估指标,显示出其在事实不一致性评估方面的巨大潜力。然而,对 ChatGPT 输出的仔细审查揭示了某些局限性,包括其对词汇更相似候选的偏好、错误推理以及对指令的理解不足。

关键词

引用

@article{arxiv.2303.15621,
  title  = {ChatGPT as a Factual Inconsistency Evaluator for Text Summarization},
  author = {Zheheng Luo and Qianqian Xie and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2303.15621},
  year   = {2023}
}

备注

ongoing work, 12 pages, 4 figures