FaithLens:检测并解释忠实性幻觉
计算与语言
2026-04-22 v4 人工智能
摘要
识别大型语言模型(LLM)输出中是否包含忠实性幻觉对于实际应用至关重要,例如检索增强生成和摘要。本文介绍FaithLens,一个高效且有效的忠实性幻觉检测模型,能够同时提供二元预测和相应的解释,以提高可信度。为实现这一目标,我们首先通过先进的LLM合成带有解释的训练数据,并应用严格定义的数据过滤策略以确保标签正确性、解释质量和数据多样性。随后,我们在这些高质量的训练数据上进行微调作为cold start,并进一步通过基于规则的强化学习进行优化,利用用于预测正确性和解释质量的奖励。12个多样化任务上的结果显示,8B参数的FaithLens在GPT-5.2和o3等先进模型中表现更出色。此外,FaithLens能够产生高质量的解释,实现了可信度、效率和效果之间的独特平衡。
引用
@article{arxiv.2512.20182,
title = {FaithLens: Detecting and Explaining Faithfulness Hallucination},
author = {Shuzheng Si and Qingyi Wang and Haozhe Zhao and Yuzhuo Bai and Guanqiao Chen and Kangyang Luo and Gang Chen and Fanchao Qi and Minjia Zhang and Baobao Chang and Maosong Sun},
journal= {arXiv preprint arXiv:2512.20182},
year = {2026}
}
备注
ACL 2026 (Findings)