中文

从 1 到 5:量化忠实性评估中的幻觉

计算与语言 2025-02-11 v3 人工智能

摘要

幻觉是自然语言生成(NLG)中的热门话题。在实际应用中,不忠实的内容可能导致数据质量差或用户信任度下降。因此,在将 NLG 用于生产环境之前进行事实核查至关重要,但如果采用人工方式则可能成本高昂。本文我们调查了在引导式 NLG 中的自动忠实性评估。我们开发了评分模板并使用大语言模型(LLM)对生成内容进行量化评分。我们比较了流行的 LLM 以及广泛采用的自然语言推理(NLI)模型在评分质量和灵敏度方面的表现。此外,我们开发了合成不可信数据生成方法,以及量化幻觉比例的启发式方法。我们的结果表明,在 4 个旅游领域的行业数据集上,GPT-4 能够提供准确的判断和解释,判断来源与生成内容是否在事实上保持一致。 Furthermore, 我们发现,通过在合成数据上微调 NLI 模型可以提高性能。最后,我们present insights on the latency and cost of deploying such a system。

关键词

引用

@article{arxiv.2410.12222,
  title  = {On A Scale From 1 to 5: Quantifying Hallucination in Faithfulness Evaluation},
  author = {Xiaonan Jing and Srinivas Billa and Danny Godbout},
  journal= {arXiv preprint arXiv:2410.12222},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Findings. 16 pages, 10 tables, 3 figures