中文

PoLLMgraph: 通过状态转移动力学揭示大型语言模型中的幻觉

计算与语言 2024-04-09 v1 密码学与安全 软件工程

摘要

尽管近年来大型语言模型(LLMs)取得了巨大进步,但其实际部署面临的一个尤为紧迫的挑战是幻觉现象,即模型编造事实并产生非事实性陈述。为此,我们提出了PoLLMgraph,一种用于LLMs的多面检测方法,作为一种有效的基于模型的白盒检测和预测方法。PoLLMgraph与现有大量专注于通过黑盒评估解决此类挑战的研究截然不同。特别地,我们证明通过可处理的概率模型分析LLM在生成过程中的内部状态转移动力学,可以有效地检测幻觉。在各种开源LLM上的实验结果证实了PoLLMgraph的有效性,在TruthfulQA等常见基准数据集上,AUC-ROC指标提升了超过20%,显著优于最先进的方法。我们的工作为基于模型的白盒分析LLMs开辟了新途径,激励研究界进一步探索、理解和完善LLM行为的复杂动力学。

关键词

引用

@article{arxiv.2404.04722,
  title  = {PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics},
  author = {Derui Zhu and Dingfan Chen and Qing Li and Zongxiong Chen and Lei Ma and Jens Grossklags and Mario Fritz},
  journal= {arXiv preprint arXiv:2404.04722},
  year   = {2024}
}

备注

15 pages