中文

UFO:一个用于评估大语言模型事实性的统一且灵活的框架

计算与语言 2024-02-23 v1

摘要

大语言模型(LLM)生成的文本可能与人类知识不一致,从而导致事实不准确或幻觉。现有用于评估 LLM 事实性的研究涉及使用 LLM 提取事实声明,并针对预定义的事实来源对其进行验证。然而,这些评估指标是特定于任务的且不可扩展,并且不同任务中事实来源的可替代性尚未得到充分探索。为了应对这些挑战,我们将四种可用的事实来源分类为:人工撰写的证据、参考文档、搜索引擎结果和 LLM 知识,以及包含六个代表性数据集的五项文本生成任务。然后,我们提出了 UFO,一个基于 LLM 的统一且灵活的评估框架,用于针对即插即用的事实来源验证事实。我们基于该框架实现了五种评估场景。实验结果表明,对于大多数问答任务,人工撰写的证据和参考文档至关重要,并且它们在检索增强的问答任务中可以相互替代。在新闻事实生成任务中,搜索引擎结果和 LLM 知识是必不可少的。我们的数据集和代码可在 https://github.com/WaldenRUC/UFO 获取。

关键词

引用

@article{arxiv.2402.14690,
  title  = {UFO: a Unified and Flexible Framework for Evaluating Factuality of Large Language Models},
  author = {Zhaoheng Huang and Zhicheng Dou and Yutao Zhu and Ji-rong Wen},
  journal= {arXiv preprint arXiv:2402.14690},
  year   = {2024}
}

备注

under review