中文

基于多空题考试方法提高大语言模型零资源幻觉检测效果

计算与语言 2024-09-27 v1 人工智能

摘要

大型语言模型(LLM)常制造幻觉文本。已 developing 多种方法通过语义比较其概率性重新生成的多个版本来检测此类文本,但显著问题是如果每段重新生成文本的情节发生变化,则生成的文本难以进行比较,这会降低检测准确性。本文提出了一种采用多空题考试方法的幻觉检测方法,以解决上述情节变更问题。首先,我们的方法通过掩码原始文本中的多个对象创建多空题考试。其次,对 LLM 提示其重复回答此考试。这种方法确保了考试答案的情节与原始情节一致。最后,通过对每个原句进行评分来量化其幻觉程度,考虑到原文本本身可能存在的“幻觉雪崩”。实验结果表明,我们的方法单独使用时不仅优于现有方法,还在与现有方法集成时实现了更清晰的领先性能。

关键词

引用

@article{arxiv.2409.17173,
  title  = {A Multiple-Fill-in-the-Blank Exam Approach for Enhancing Zero-Resource Hallucination Detection in Large Language Models},
  author = {Satoshi Munakata and Taku Fukui and Takao Mohri},
  journal= {arXiv preprint arXiv:2409.17173},
  year   = {2024}
}

备注

20 pages