更少的幻觉是否意味着更少的创造力?LLM 中的实证研究
计算与语言
2026-01-22 v2 人工智能
摘要
大型语言模型(LLMs)在自然语言理解和推理方面展现出卓越能力,但存在幻觉问题:生成事实不正确的内容。虽然已经开发了许多减少幻觉的方法,但它们对创造性生成的影响尚未被探索。这一差距对于 AI 辅助的科学发现尤为重要,因为科学发现既需要事实准确性也需要创造性假设生成。我们研究了三种幻觉减少技术——验证链(CoVe)、对比层解码(DoLa)和检索增强生成(RAG)——对 LLM 创造力的影响。我们在两个创造力基准(NeoCoder 和 CS4)上评估了多个模型家族(LLaMA、Qwen、Mistral),规模从 1B 到 70B 参数不等,发现这些方法对发散创造力具有相反的影响。CoVe 增强了发散思维,DoLa 抑制了它,而 RAG 表现出最小的影响。我们的发现为在科学应用中选择适当的幻觉减少方法提供了指导,在这些应用中,事实准确性与创造性探索之间的平衡至关重要。
引用
@article{arxiv.2512.11509,
title = {Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs},
author = {Mohor Banerjee and Nadya Yuki Wangsajaya and Syed Ali Redha Alsagoff and Min Sen Tan and Zachary Choy Kit Chun and Alvin Chan Guo Wei},
journal= {arXiv preprint arXiv:2512.11509},
year = {2026}
}
备注
Accepted at the AAAI 2026 Workshop on AI for Scientific Research (AI4Research)