中文

HalluGuard:用于缓解检索增强生成中幻觉的证据导向小型推理模型

计算与语言 2025-10-02 v1

摘要

大型语言模型(LLMs)在许多NLP任务中表现出色,但仍容易产生幻觉,限制了其在实际应用中的可信度。我们 presented HalluGuard,这是一个4B参数的小型推理模型(SRM),用于缓解检索增强生成(RAG)中的幻觉。HalluGuard对文档-主张对进行grounded或幻觉分类,并为透明度生成证据导向的依据。我们的方法结合了(i)从FineWeb派生并通过多阶段精选和数据重构的领域无关的合成数据集,(ii)合成的grounded和幻觉主张,以及(iii)基于Odds比例偏好优化的偏好微调,以将大型模型推理蒸馏到较小的 backbone。 在LLM-AggreFact基准的RAGTruth子集上,HalluGuard实现了84.0%的平衡准确率(BAcc),与专用模型MiniCheck(7B; 84.0%)和Granite Guardian 3.3(8B; 82.2%)相当,但参数数量仅为其的一半。在完整基准上,它达到了75.7%的BAcc,与更大型的通用purpose LLM如GPT-4o(75.9%)相匹配。我们将在接受后在Apache 2.0许可下发布HalluGuard和数据集。

关键词

引用

@article{arxiv.2510.00880,
  title  = {HalluGuard: Evidence-Grounded Small Reasoning Models to Mitigate Hallucinations in Retrieval-Augmented Generation},
  author = {Loris Bergeron and Ioana Buhnila and Jérôme François and Radu State},
  journal= {arXiv preprint arXiv:2510.00880},
  year   = {2025}
}