中文

OpenFactCheck:用于 LLM 事实性评估的统一框架

计算与语言 2025-10-30 v3 人工智能

摘要

大型语言模型(LLM)在广泛的实际应用中日益增长的使用,使得自动检查其输出事实准确性的工具变得必不可少,因为 LLM 常常会产生幻觉。这一问题的难点在于需要评估自由形式的开放领域响应的事实性。尽管已有大量研究,但不同论文使用不同的评估基准和措施,使其难以比较,并阻碍了未来的进展。为缓解此问题,我们开发了 OpenFactCheck,一个统一框架,包含三个模块:(i)RESPONSEEVAL,允许用户轻松自定义自动事实检查系统,并使用该系统评估输入文档中所有主张的事实性;(ii)LLMEVAL,评估 LLM 的整体事实性;(iii)CHECKEREVAL,用于评估自动事实检查系统。OpenFactCheck 已开源(https://github.com/mbzuai-nlp/openfactcheck),并以 Python 库形式公开发布(https://pypi.org/project/openfactcheck/),也提供网页服务(http://app.openfactcheck.com)。系统介绍视频可在 https://youtu.be/-i9VKL0HleI 查看。

关键词

引用

@article{arxiv.2408.11832,
  title  = {OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs},
  author = {Hasan Iqbal and Yuxia Wang and Minghan Wang and Georgi Georgiev and Jiahui Geng and Iryna Gurevych and Preslav Nakov},
  journal= {arXiv preprint arXiv:2408.11832},
  year   = {2025}
}

备注

11 pages, 4 Figures, 3 Tables, Published In Proceedings of The 2024 Conference on Empirical Methods in Natural Language Processing