中文

净化灰色地带:基于潜在几何的去噪以实现精准知识边界感知

计算与语言 2026-04-17 v1

摘要

大型语言模型(LLM)因无法准确感知自身知识边界而常出现幻觉现象。现有的拒绝微调方法通常直接基于响应准确率划分数据集,导致模型在决策边界附近受到严重标签噪声的影响,从而表现出高比率的拒绝或幻觉。本文从潜在空间表示的角度揭示,决策超平面附近存在“灰色地带”,其中内部信念的模糊性构成了核心性能瓶颈。基于此洞察,我们提出了 **GeoDe**(**Geo**metric **De**noising)框架用于拒绝微调。该方法通过线性探针构建真相超平面,并利用几何距离作为自信度信号进行“几何去噪”,从而过滤掉模糊边界样本,同时保留高保真信号用于微调。实验在多个模型(Llama3、Qwen3)和基准数据集(TriviaQA、NQ、SciQ、SimpleQA)上表明,GeoDe显著提升模型的真实性,并在跨域(OOD)场景中显示出强大的泛化能力。代码已公开于 https://github.com/Notbesidemoon/GeoDe。

关键词

引用

@article{arxiv.2604.14324,
  title  = {Purging the Gray Zone: Latent-Geometric Denoising for Precise Knowledge Boundary Awareness},
  author = {Hao An and Yibin Lou and Jiayi Guo and Yang Xu},
  journal= {arXiv preprint arXiv:2604.14324},
  year   = {2026}
}

备注

ACL 2026 Findings