中文

MiniCheck:对 LLM 生成的 grounding 文档进行高效事实核查

计算与语言 2024-10-02 v2 人工智能

摘要

识别 LLM 输出是否可以 grounding 在证据中是 NLP 许多任务的核心问题:检索增强生成、摘要、文档 grounding 对话等。当前基于 LLM 的事实核查方法通过验证模型生成的每个要素来验证其潜在证据,然而这一过程可能非常昂贵,需要对单个响应进行大量模型调用。本文展示了如何构建小型事实核查模型,这些模型在性能上达到 GPT-4 水平,但成本降低了 400 倍。我们通过使用 GPT-4 构建合成训练数据来实现这一点,这涉及通过结构化的生成程序创建真实且具有挑战性的事实性错误。训练这些数据有助于教导模型检查 claims 中的每个事实并识别跨句子的信息综合。对于评估,我们将来自最近工作的事实核查和 grounding LLM 生成的数据集统一到一个新的基准测试中,称为 LLM-AggreFact。我们最好的系统 MiniCheck-FT5(770 百万参数)在 comparable 大小的所有系统中均超越,并达到了 GPT-4 准确度。我们发布了 LLM-AggreFact、数据综合代码以及模型。

关键词

引用

@article{arxiv.2404.10774,
  title  = {MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents},
  author = {Liyan Tang and Philippe Laban and Greg Durrett},
  journal= {arXiv preprint arXiv:2404.10774},
  year   = {2024}
}

备注

EMNLP 2024