中文

HAUNT:通过对抗性引导探测 LLM 自我一致性

计算与语言 2025-11-13 v1 人工智能 计算机与社会

摘要

幻觉是大型语言模型(LLM)在高风险领域部署的关键挑战。本文提出一个用于测试 LLM 在对抗性引导下事实忠诚度的框架。我们的框架包含三个步骤。第一步,我们指示 LLM 生成一组与特定封闭领域相符的真实与虚假陈述。下一步,我们指示 LLM 将相同的断言分别视为与同一封闭领域相符的真实与虚假。最后,我们测试 LLM 对自身生成的虚假所展现出的韧性。我们的广泛评估使用五个广为人知的专有 LLM,涵盖流行电影和小说两个封闭领域,揭示了对抗性引导的广泛易受性:Claude 表现出强韧性,GPT 和 Grok 表现出中等韧性,而 Gemini 和 DeepSeek 表现出弱韧性。考虑到大量用户日益倾向于使用 LLM 进行信息检索,我们的发现提出了警示。

关键词

引用

@article{arxiv.2511.08596,
  title  = {What About the Scene with the Hitler Reference? HAUNT: A Framework to Probe LLMs' Self-consistency Via Adversarial Nudge},
  author = {Arka Dutta and Sujan Dutta and Rijul Magu and Soumyajit Datta and Munmun De Choudhury and Ashiqur R. KhudaBukhsh},
  journal= {arXiv preprint arXiv:2511.08596},
  year   = {2025}
}