可信变换:用于量化和缓解大语言模型幻觉的原则方法
计算与语言
2025-10-15 v1 人工智能
摘要
大语言模型(lms)会产生事实错误却自信满满的断言。我们认为,这源于变换的 softmax 函数会通过折叠模糊注意力分数到单个概率分布中,丢弃每一层的不确定性信息。为此,我们提出了可信变换,通过基于证据理论的可信注意力机制(cam)来取代标准注意力。cam 生成一个"可信集"(一组分布)而非单个注意力向量,其集合大小直接测量模型的不确定性。我们通过将注意力分数重新概念化为狄利克雷分布的证据质量来实现这一点:充分的证据恢复标准注意力,而不足的证据则产生一个扩散分布,表征歧义。经验上,可信变换识别离群输入,量化歧义,并通过妥协显著减少无法回答问题上的自信错误。我们的贡献是一种新的体系结构来缓解幻觉,以及一种将不确定性量化直接集成到模型中的设计范式,为更可靠的 ai 提供了基础。
引用
@article{arxiv.2510.12137,
title = {Credal Transformer: A Principled Approach for Quantifying and Mitigating Hallucinations in Large Language Models},
author = {Shihao Ji and Zihui Song and Jiajie Huang},
journal= {arXiv preprint arXiv:2510.12137},
year = {2025}
}