如何检测并击破分子幻象:面向基于LLM的分子理解的幻觉度量驱动基准
计算与语言
2025-04-18 v1 人工智能
摘要
大型语言模型正日益应用于科学领域,尤其是分子理解与分析。然而,现有模型受幻觉问题影响,导致在药物设计与使用中出现错误。在本文中,我们首先分析了LLMs在分子理解任务中幻觉的来源,特别是PubChem数据集中观察到的知识捷径现象。为以计算效率评估分子理解任务中的幻觉,我们引入了\textbf{Mol-Hallu},一种新颖的自由形式评估指标,基于生成文本与实际分子属性之间的科学蕴含关系来量化幻觉程度。利用Mol-Hallu指标,我们重新评估并分析了执行分子理解任务的各种LLMs的幻觉程度。此外,提出了幻觉消除后处理阶段(HRPP)以缓解分子幻觉。实验表明HRPP在纯解码器和编码器-解码器分子LLMs上的有效性。我们的发现为缓解幻觉及提升LLMs在科学应用中的可靠性提供了关键见解。
引用
@article{arxiv.2504.12314,
title = {How to Detect and Defeat Molecular Mirage: A Metric-Driven Benchmark for Hallucination in LLM-based Molecular Comprehension},
author = {Hao Li and Liuzhenghao Lv and He Cao and Zijing Liu and Zhiyuan Yan and Yu Wang and Yonghong Tian and Yu Li and Li Yuan},
journal= {arXiv preprint arXiv:2504.12314},
year = {2025}
}
备注
17 pages