VERISCORE:用于评估可验证论断在长文本生成中的事实性
计算与语言
2024-06-28 v1
摘要
现有用于评估长文本事实性的指标,如 FACTSCORE(Min 等,2023)和 SAFE(Wei 等,2024),将输入文本分解为“原子论断”,并对每个论断进行事后验证。这些指标不适用于大多数生成任务,因为它们假设每个论断都可被验证(即可能被证明为真或假)。我们提出了 VERISCORE,这是一个针对包含可验证与不可验证内容的多样化长文本生成任务的指标。VERISCORE 可通过封闭式或微调的开源语言模型有效实现,人类评估确认,VERISCORE 提取的论断在八种不同长文本任务中比竞争方法更合理。我们使用 VERISCORE 评估了 16 个不同模型在多种长文本任务中的生成结果,发现尽管 GPT-4o 在整体上表现最佳,但开源模型如 Mixtral-8x22 正在缩小差距。我们展示了语言模型在一个任务上的 VERISCORE(例如, biography 生成)不一定与在不同任务上的 VERISCORE(例如,长篇问答)相关,这凸显了在事实密度各异的任务上扩展事实性评估的必要性。
引用
@article{arxiv.2406.19276,
title = {VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation},
author = {Yixiao Song and Yekyung Kim and Mohit Iyyer},
journal= {arXiv preprint arXiv:2406.19276},
year = {2024}
}