中文

TofuEval:评估大语言模型在主题聚焦对话摘要中的幻觉

计算与语言 2024-04-02 v2 人工智能

摘要

近年来,单文档新闻摘要在忠实度方面取得了显著进展,这得益于对事实一致性或幻觉评估的研究。我们询问这些进展是否适用于其他文本摘要领域。我们提出了一个新的评估基准,针对由不同规模的大语言模型 (LLM) 生成的主题聚焦对话摘要。我们提供了这些摘要在句子级别的事实一致性的二元人工标注,以及对事实不一致句子的详细解释。我们的分析表明,现有的 LLM 在对话领域会产生大量事实错误幻觉,无论模型规模大小如何。另一方面,当包括 GPT-4 在内的 LLM 作为二元事实评估器时,其表现不佳,且可能被现行的最先进 (SOTA) 专用事实性评估指标超越。最后,我们通过精心策划的错误分类法对幻觉类型进行了分析。我们发现模型生成的摘要中存在多样化的错误和错误分布,且基于非 LLM 的指标比基于 LLM 的评估器能更好地捕捉所有错误类型。

关键词

引用

@article{arxiv.2402.13249,
  title  = {TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization},
  author = {Liyan Tang and Igor Shalyminov and Amy Wing-mei Wong and Jon Burnsky and Jake W. Vincent and Yu'an Yang and Siffi Singh and Song Feng and Hwanjun Song and Hang Su and Lijia Sun and Yi Zhang and Saab Mansour and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2402.13249},
  year   = {2024}
}

备注

NAACL 2024; Linguistic annotations available at https://github.com/amazon-science/tofueval