RAGognizer:基于检测头集成的误识感知微调
计算与语言
2026-04-20 v1 机器学习
摘要
检索增强生成(RAG)广泛用于为大型语言模型(LLM)的输入增添外部信息,如最新或特定领域的知识。尽管如此,当前模型仍会产生闭域误识,并生成不受检索上下文支持的内容。当前的检测方法通常将误识视为后置问题,依赖冻结内部表征上的黑盒一致性检查或探针。在本工作中,我们展示了基于内部状态表征的误识检测也可作为直接训练信号。我们引入 RAGognize,一个包含自然发生闭域误识且包含标记级注释的数据集,以及 RAGognizer,一种误识感知微调方法,通过在 LLM 中集成轻量级检测头,实现语言建模与误识检测的联合优化。这种联合目标迫使模型提高其内部状态关于误识的可分离性,同时学习生成结构良好且富有意义的响应。我们在多个基准测试上表明,RAGognizer 在标记级误识检测方面实现了最先进水平,同时显著降低生成期间的误识率,且不影响语言质量或相关性。
引用
@article{arxiv.2604.15945,
title = {RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration},
author = {Fabian Ridder and Laurin Lessel and Malte Schilling},
journal= {arXiv preprint arXiv:2604.15945},
year = {2026}
}
备注
accepted at IJCNN 2026