语义 grounding 指数:检索增强生成系统中上下文参与的几何界限
人工智能
2025-12-17 v1
摘要
当检索增强生成(RAG)系统出现幻觉时,这在嵌入空间留下何种几何痕迹?我们引入语义 grounding 指数(SGI),定义为响应到问题角度距离与响应到上下文角度距离之比,在单位超球面 上。我们的核心发现是\emph{语义懒惰}:幻觉响应保持与问题的角度接近,而非向检索到的上下文方向偏离。在HaluEval (=5,000) 上,我们观察到在五个嵌入模型中均出现较大效应大小(Cohen's 范围为0.92至1.28),平均跨模型相关系数 =0.85。关键的是,我们从球面三角不等式推导出SGI的判别能力随问题-上下文角度分离 的增加而提升——这一理论预测在实证中得到验证:效应大小从 =0.61\theta(q,c)d(高 ),AUC从0.72提升至0.83。子组分析显示,SGI在长回复(=2.05)和短问题(=1.22)时表现最佳,同时在不同上下文长度下保持稳健。校准分析得到ECE=0.10,表明SGI得分可作为概率估计,而非仅限于排序。针对TruthfulQA(AUC=0.478)的关键性负结果表明,角几何测度衡量的是主题参与度而非事实准确性。SGI提供了计算高效、理论依据扎实的基础设施,用于识别生产环境中值得核查的响应。
引用
@article{arxiv.2512.13771,
title = {Semantic Grounding Index: Geometric Bounds on Context Engagement in RAG Systems},
author = {Javier Marín},
journal= {arXiv preprint arXiv:2512.13771},
year = {2025}
}