中文

OpenFActScore:面向原子级文本生成事实性评估的开源实现

计算与语言 2025-07-09 v1 人工智能

摘要

我们提出 OpenFActScore,这是 FActScore 框架的开源实现,用于评估大型语言模型(LLM)生成文本的事实性。FActScore 通过原子化事实生成(AFG)提取出单独的事实性声明,再通过原子化事实验证(AFV)将每个声明核查于可信知识来源。虽然原始 FActScore 依赖闭源商业模型如 InstructGPT 和 ChatGPT,但 OpenFActScore 允许使用任何兼容 Hugging Face 的模型完成 AFG 和 AFV。我们提供详细的技术概述,突出支持开源模型的设计选择和修改。我们在原始 FActScore 数据集上对多款开源 LLM进行 AFG 和 AFV 评估,报告 BERTScore-F1 用于 AFG,报告相对于人工标注的错误率用于 AFV。结果显示,开源模型可接近闭源系统的性能,Gemma 在综合性能上表现最佳,而我们的最终方案与原始 FActScore 实验的皮尔逊相关系数达 0.99。OpenFActScore 促进了透明度、可复现性和成本效益评估,已公开于:https://github.com/lflage/OpenFActScore。

关键词

引用

@article{arxiv.2507.05965,
  title  = {OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation},
  author = {Lucas Fonseca Lage and Simon Ostermann},
  journal= {arXiv preprint arXiv:2507.05965},
  year   = {2025}
}

备注

Submitted to EMNLP 2025 System Demonstrations track