Drowzee:基于逻辑编程的大型语言模型事实冲突幻觉检测的变形测试
软件工程
2024-09-04 v2
摘要
大型语言模型 (LLM) 已深刻改变语言处理领域,但在安全、隐私以及生成看似连贯但事实不准确的输出(即幻觉)方面面临重大挑战。其中,尤其棘手的是事实冲突幻觉 (FCH),即LLM生成的内容与既定事实直接矛盾。解决FCH面临两大障碍:其一,自动构建和更新基准数据集具有挑战性,因当前方法依赖不涵盖多样化FCH情景的静态基准;其二,验证LLM输出的推理过程本质上复杂,尤其涉及复杂逻辑关系。针对这些障碍,我们提出一种创新方法,利用逻辑编程增强变形测试以检测事实冲突幻觉 (FCH)。我们的方法从维基百科等数据源收集信息,通过逻辑推理扩展以创建多样化测试用例,对LLM进行结构化提示评估,并使用语义感知评估机制验证其连贯性。该方法在六个不同LLM跨九个领域生成测试用例并检测幻觉,幻觉率范围为24.7%至59.8%。关键观察表明,LLM在处理时序概念、处理分布外知识以及表现出逻辑推理能力不足方面面临挑战。这些结果凸显了基于逻辑生成的测试用例在触发和识别幻觉方面的有效性。这些发现进一步凸显了社区在检测和解决LLM幻觉方面需要持续合作的紧迫性。
引用
@article{arxiv.2405.00648,
title = {Drowzee: Metamorphic Testing for Fact-Conflicting Hallucination Detection in Large Language Models},
author = {Ningke Li and Yuekang Li and Yi Liu and Ling Shi and Kailong Wang and Haoyu Wang},
journal= {arXiv preprint arXiv:2405.00648},
year = {2024}
}
备注
29 pages, 11 figures, 4 tables, to appear in OOPSLA'24 (Vol.8, No.OOPSLA2, Article 336)