中文

Cleanse:基于聚类语义一致性的 LLM 不确定性估计方法

计算与语言 2025-07-22 v1 人工智能

摘要

尽管大型语言模型(LLMs)在 various NLP 任务中表现卓越,但 LLM 中的幻觉——即 LLM 生成不准确的响应——仍然是一个关键问题,因为它可以直接关联到构建安全可靠 LLM 的危机。不确定性估计主要用于衡量 LLM 响应的幻觉水平,以便清晰地区分正确和错误的答案。本研究提出一种有效的不确定性估计方法,即基于聚类的语义一致性(Cleanse)。Cleanse 通过计算 LLM 隐藏嵌入中在总体一致性中的局部聚类一致性比例来量化不确定性,后者包含足够的语义信息来表征生成内容,通过采用聚类技术来实现。通过使用四个 off-the-shelf 模型(LLaMA-7B、LLaMA-13B、LLaMA2-7B 和 Mistral-7B)和两个问答基准数据集(SQuAD 和 CoQA),验证了 Cleanse 用于检测幻觉的有效性。

关键词

引用

@article{arxiv.2507.14649,
  title  = {Cleanse: Uncertainty Estimation Approach Using Clustering-based Semantic Consistency in LLMs},
  author = {Minsuh Joo and Hyunsoo Cho},
  journal= {arXiv preprint arXiv:2507.14649},
  year   = {2025}
}