FELM:大语言模型事实性评估基准
计算与语言
2023-11-29 v2
摘要
评估大语言模型(LLMs)生成文本的事实性是一个新兴却关键的研究领域,旨在提醒用户潜在错误并指导开发更可靠的 LLMs。然而,评估事实性的评测器自身也需要恰当评估以衡量进展并促进进步。该方向仍待充分探索,导致事实性评测器的进展受到严重阻碍。为缓解此问题,我们引入一个名为 felm 的大语言模型事实性评估(Factuality Evaluation of Large Language Models)基准。在该基准中,我们收集 LLMs 生成的回复,并以细粒度方式标注事实性标签。与以往主要聚焦于世界知识(如维基百科信息)事实性的研究不同,felm 关注跨越多样领域的事实性,从世界知识到数学与推理。我们的标注基于文本片段,可帮助定位具体事实错误。事实性标注进一步由预定义错误类型及支持或反驳该陈述的参考链接所补充。在实验中,我们考察了若干基于 LLM 的事实性评测器在 felm 上的表现,包括朴素 LLMs 以及增强检索机制与思维链过程的 LLMs。我们发现,尽管检索有助于事实性评估,当前 LLMs 远未能令人满意地忠实检测事实错误。
引用
@article{arxiv.2310.00741,
title = {FELM: Benchmarking Factuality Evaluation of Large Language Models},
author = {Shiqi Chen and Yiran Zhao and Jinghan Zhang and I-Chun Chern and Siyang Gao and Pengfei Liu and Junxian He},
journal= {arXiv preprint arXiv:2310.00741},
year = {2023}
}
备注
Accepted by NeurIPS 2023 Track on Datasets and Benchmarks