可靠科学假设生成:评估大语言模型中的真实性与幻觉
计算与语言
2025-06-10 v2 人工智能
摘要
大型语言模型(LLMs)在生物医学等科学领域展现出巨大的潜力,尤其是在假设生成方面,它们可以分析广泛的文献、识别模式并提出研究方向。然而,一个关键挑战在于评估生成假设的真实性,因为验证其准确性通常需要大量时间和资源。此外,LLMs 的幻觉问题可能导致生成看似合理但最终错误的假设,从而削弱其可靠性。为促进这些挑战的系统性研究,我们引入了用于评估 LLMs 生成真实科学假设能力的基准测试 TruthHypo,以及基于知识的幻觉检测器 KnowHD,以评估假设在现有知识中的扎实程度。我们的结果表明,LLMs 在生成真实假设方面存在困难。通过分析推理步骤中的幻觉,我们展示了 KnowHD 提供的扎实得分作为过滤 LLMs 生成多样输出中真实假设的有效指标。人类评估进一步验证了 KnowHD 在识别真实假设和加速科学发现方面的实用性。我们的数据和源代码已在 https://github.com/Teddy-XiongGZ/TruthHypo 上提供。
引用
@article{arxiv.2505.14599,
title = {Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models},
author = {Guangzhi Xiong and Eric Xie and Corey Williams and Myles Kim and Amir Hassan Shariatmadari and Sikun Guo and Stefan Bekiranov and Aidong Zhang},
journal= {arXiv preprint arXiv:2505.14599},
year = {2025}
}
备注
Accepted to IJCAI 2025