基于场论建模的LLM幻觉检测方法——HalluField
机器学习
2025-09-16 v1 人工智能
摘要
大型语言模型(LLM)在推理和问答能力上表现突出,但常产生不准确或不可靠的内容,称为幻觉。这种不可靠性显著限制了其在高风险应用中的部署。因此, 有迫切需要一种通用方法来检测LLM中的幻觉。本文引入HalluField, 一种基于参数化变分原理和热力学的新型场论方法, 用于幻觉检测。受热力学启发,HalluField将LLM对给定查询和温度设置的响应建模为一组离散概率路径, 每个路径都关联能量和熵。通过分析能量和熵分布在温度和概率变化下的token路径,HalluField量化了响应的语义稳定性。通过识别能量景观中的不稳定或波动行为来检测幻觉。HalluField计算高效且实用: 它直接作用于模型输出的logits, 无需微调或额外神经网络。值得注意的是,该方法建立在原理性物理解释之上, 借鉴了热力学第一定律的类比。通过这种物理视角模型化LLM行为,HalluField在不同模型和数据集上实现了幻觉检测的领先性能。
引用
@article{arxiv.2509.10753,
title = {HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling},
author = {Minh Vu and Brian K. Tran and Syed A. Shah and Geigh Zollicoffer and Nhat Hoang-Xuan and Manish Bhattarai},
journal= {arXiv preprint arXiv:2509.10753},
year = {2025}
}