HALT-RAG:一种基于校准NLI集成与弃权的任务自适应幻觉检测框架
计算与语言
2025-09-10 v1 人工智能
摘要
检测与给定源文本相矛盾或缺乏支持的内容,是生成式语言模型安全部署的一个关键挑战。我们引入了HALT-RAG,这是一个事后验证系统,旨在识别检索增强生成(RAG)流程输出中的幻觉。我们灵活且任务自适应的框架使用了一个通用特征集,该特征集源自两个冻结的、现成的自然语言推理(NLI)模型的集成以及轻量级词汇信号。这些特征用于训练一个简单的、经过校准且适应任务的元分类器。我们采用严格的5折袋外(OOF)训练协议以防止数据泄露并产生无偏估计,并在HaluEval基准上评估了我们的系统。通过将我们的通用特征集与一个轻量级、任务自适应的分类器以及一个精度约束的决策策略相结合,HALT-RAG在摘要、问答和对话任务上分别取得了0.7756、0.9786和0.7391的强OOF F1分数。该系统校准良好的概率实现了一种实用的弃权机制,为平衡模型性能与安全要求提供了一个可靠的工具。
引用
@article{arxiv.2509.07475,
title = {HALT-RAG: A Task-Adaptable Framework for Hallucination Detection with Calibrated NLI Ensembles and Abstention},
author = {Saumya Goswami and Siddharth Kurra},
journal= {arXiv preprint arXiv:2509.07475},
year = {2025}
}