中文

FActScore:长文本生成中事实准确性的细粒度原子化评估

计算与语言 2023-10-12 v2 人工智能 机器学习

摘要

评估大型语言模型(LMs)生成长文本的事实性并非易事,因为(1)生成内容常混杂受支持与不受支持的信息片段,使得二值质量判断不够充分;(2)人工评估耗时且昂贵。本文中,我们引入 FACTSCORE,一种将生成内容拆解为一系列原子事实并计算由可靠知识源支持的原子事实占比的新评估方法。我们开展了广泛的人工评估,以获得若干最先进商业 LMs——InstructGPT、ChatGPT 以及检索增强的 PerplexityAI——所生成人物传记的 FACTSCORE,并报告了新的分析以证明此类细粒度分数的必要性(例如 ChatGPT 仅达 58%)。由于人工评估成本高,我们还引入了一个利用检索与强语言模型估算 FACTSCORE 的自动化模型,其误差率低于 2%。最后,我们使用该自动指标评估了来自一组 13 个近期 LMs 的新集合的 6,500 条生成(若由人工评估将耗资 $26K),得到多项发现:GPT-4 与 ChatGPT 比公开模型更具事实性,而 Vicuna 与 Alpaca 是其中最好的公开模型之一。FACTSCORE 已可通过 `pip install factscore` 公开使用。

关键词

引用

@article{arxiv.2305.14251,
  title  = {FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation},
  author = {Sewon Min and Kalpesh Krishna and Xinxi Lyu and Mike Lewis and Wen-tau Yih and Pang Wei Koh and Mohit Iyyer and Luke Zettlemoyer and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2305.14251},
  year   = {2023}
}

备注

25 pages; 7 figures. Published as a main conference paper at EMNLP 2023. Code available at https://github.com/shmsw25/FActScore