面向大语言模型可靠性增强的置信感知路由:预生成幻觉缓解的多信号方法
计算与语言
2025-10-03 v1 人工智能
摘要
大语言模型存在幻觉问题,会生成看似合理但事实错误的内容。现有的缓解策略侧重于生成后修正,这计算成本高且无法阻止不可靠内容的生成。我们提出了一种置信感知路由系统,在生成之前主动评估模型不确定性,并根据估计的可靠性重定向查询。我们的方法结合了三种互补信号:内部表示与参考嵌入之间的语义对齐、模型层间的内部收敛分析,以及学习到的置信度估计。统一的置信度分数决定路由至四条路径:高置信度的本地生成、中置信度的检索增强生成、低置信度的大模型,以及极低置信度的人工审核。在知识密集型问答基准上的评估表明,在幻觉检测方面取得了显著提升(0.74对比0.42基线),同时相比生成后方法降低了40%的计算成本。F1分数从0.61提升至0.82,且假阳性率较低(0.09)。从反应式修正到主动评估的这一范式转变,提供了一种计算高效的LLM可靠性增强方法。
引用
@article{arxiv.2510.01237,
title = {Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation},
author = {Nandakishor M},
journal= {arXiv preprint arXiv:2510.01237},
year = {2025}
}