中文

Lynx:一个开源的幻觉评估模型

人工智能 2024-07-24 v2 计算与语言

摘要

检索增强生成 (RAG) 技术旨在缓解大型语言模型 (LLM) 中的幻觉问题。然而,LLM 仍可能产生与检索上下文不受支持或矛盾的信息。我们介绍 LYNX,一个在挑战性真实世界幻觉情境中具有高级推理能力的 SOTA 幻觉检测 LLM。为评估 LYNX,我们提出 HaluBench,一个来自 various 真实世界领域的综合性幻觉评估基准,包含 15000 个样本。我们的实验结果表明,LYNX 在 HaluBench 上超越 GPT-4o、Claude-3-Sonnet 以及封闭式和开源 LLM 评判模型。我们发布 LYNX、HaluBench 以及我们的评估代码供公众访问。

关键词

引用

@article{arxiv.2407.08488,
  title  = {Lynx: An Open Source Hallucination Evaluation Model},
  author = {Selvan Sunitha Ravi and Bartosz Mielczarek and Anand Kannappan and Douwe Kiela and Rebecca Qian},
  journal= {arXiv preprint arXiv:2407.08488},
  year   = {2024}
}