HACK:确定性与知识轴上的幻觉
微分几何
2025-10-29 v1
摘要
大语言模型(LLM)中的幻觉构为其可靠使用的关键障碍。现有研究通常通过外部属性来分类幻觉,而非考虑LLM内部的底层属性。这种外部焦点忽略了幻觉可能需要基于其底层机制进行针对性缓解策略。我们提出了一种框架,通过两个轴来分类幻觉:知识和确定性。由于参数化知识和确定性可能因模型而异,我们的分类方法涉及针对不同类型幻觉构建模型特定的数据集。沿知识轴,我们区分了因缺乏知识而导致的幻觉与即使模型拥有正确响应的知识仍发生幻觉的幻觉。为验证知识轴上的分类,我们应用了驾驭技术,这一技术依赖于参数化知识来操控模型激活,从而解决了现有方法无法验证知识分类的问题,表明两种幻觉类型之间存在显著差异。我们进一步分析了不同模型之间独特的知识和幻觉模式,表明尽管共享参数化知识,仍会发生不同的幻觉。转向确定性轴,我们识别出一类尤为令人担忧的幻觉子集,即模型在拥有正确内部知识的情况下仍以确定性幻觉。我们引入了一种新型评估指标来衡量此类子集上缓解方法的有效性,揭示尽管某些方法在平均情况下表现良好,但在这些关键案例上却表现不佳。我们的发现突显了在幻觉分析中考虑知识和确定性的重要性,并呼吁针对幻觉底层因素的针对性缓解方法。
引用
@article{arxiv.2510.24221,
title = {Hopf differentials and curvature line flows on time-like CMC surfaces},
author = {Naoya Ando and Masaaki Umehara},
journal= {arXiv preprint arXiv:2510.24221},
year = {2025}
}