HalluShift: 衡量大语言模型向幻觉检测方向的分布迁移
计算与语言
2025-04-15 v1 人工智能
新兴技术
摘要
大语言模型(LLMs)因其在众多领域中对给定提示生成创新性响应的卓越能力而近年来广受关注。然而,LLMs常常存在幻觉,生成结构有序且连贯的错误信息。本文假设,幻觉源于LLMs的内部动态。我们的观察表明,在生成段落时,LLMs倾向于在响应的细微部分偏离事实准确性,最终转向错误信息。这一现象类似于人类认知,人类在保持逻辑连贯性的同时可能在言语的细微部分产生幻觉,嵌入不确定性。为进一步探讨此现象,我们引入一种新方法HalluShift,用于分析LLM生成响应的内部状态空间和标记概率的分布迁移。我们的方法在各种基准数据集上 outperform现有基线方法。我们的代码可在 https://github.com/sharanya-dasgupta001/hallushift 获取。
引用
@article{arxiv.2504.09482,
title = {HalluShift: Measuring Distribution Shifts towards Hallucination Detection in LLMs},
author = {Sharanya Dasgupta and Sujoy Nath and Arkaprabha Basu and Pourya Shamsolmoali and Swagatam Das},
journal= {arXiv preprint arXiv:2504.09482},
year = {2025}
}