中文

GenAudit:利用证据修正语言模型输出中的事实错误

计算与语言 2025-01-22 v3 机器学习

摘要

即使提供了参考文档,大语言模型(LLM)仍可能生成事实错误的陈述。此类错误在高风险应用(如医疗或金融领域的基于文档的问答)中可能带来危险。我们提出了 GenAudit——一种旨在辅助对基于文档的任务中 LLM 回答进行事实核查的工具。GenAudit 通过修订或删除参考文档不支持的主张来建议对 LLM 回答进行编辑,并为确实有支持的事实呈现来自参考文档的证据。我们训练了模型以执行这些任务,并设计了一个交互式界面,向用户展示建议的编辑和证据。由人类评估者进行的综合评估表明,GenAudit 能够在总结来自不同领域的文档时,检测出 8 种不同 LLM 输出中的错误。用户研究表明,使用 GenAudit 可以显著提高人类发现 LLM 生成摘要中错误的性能。我们发布了我们的工具(GenAudit)和事实核查模型供公众使用。

关键词

引用

@article{arxiv.2402.12566,
  title  = {GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence},
  author = {Kundan Krishna and Sanjana Ramprasad and Prakhar Gupta and Byron C. Wallace and Zachary C. Lipton and Jeffrey P. Bigham},
  journal= {arXiv preprint arXiv:2402.12566},
  year   = {2025}
}

备注

Code and models available at https://genaudit.org