中文

用于药物发现的 LLM hallucinations:提升效果

计算与语言 2025-08-25 v2 人工智能

摘要

大型语言模型(LLM)中的幻觉(plausible but factually inaccurate text)常被视为不可取。然而,近期研究表明,这类输出可能具有创造性潜力。在本文中,我们研究whether hallucinations can improve LLMs on molecule property prediction,这是早期药物发现中的关键任务。我们让 LLM 生成从分子 SMILES 字符串的自然语言描述,并将这些常常幻觉的描述纳入下游分类任务中。我们在五个数据集上评估了七个指令调优 LLM,发现幻觉显著提高了某些模型的预测准确性。值得注意的是,Falcon3-Mamba-7B 在包括幻觉文本后超过了所有基线模型,而由 GPT-4o 生成的幻觉文本 consistently 产生最大的模型间增益。我们进一步识别并归类了超过18,000个有益的幻觉,其中结构性误描述类型影响最大,这表明关于分子结构的幻觉陈述可能增加模型置信度。消融研究表明,较大的模型从幻觉中受益更多,而温度作用有限。我们的发现挑战了将幻觉仅视为纯问题的常规观点,并为科学建模任务如药物发现中利用幻觉作为有用信号的新方向指明了方向。

关键词

引用

@article{arxiv.2501.13824,
  title  = {Can Hallucinations Help? Boosting LLMs for Drug Discovery},
  author = {Shuzhou Yuan and Zhan Qu and Ashish Yashwanth Kangen and Michael Färber},
  journal= {arXiv preprint arXiv:2501.13824},
  year   = {2025}
}