如何让大语言模型生成 100% 有效的分子?
计算与语言
2025-09-30 v1 机器学习
摘要
分子生成是药物发现和材料科学的关键环节,使能于设计具有特定性质的新型化合物。大语言模型(LLMs)能够仅凭少量示例学习执行广泛任务。然而,在少样本设置下使用 SMILES 等表示方法生成有效分子仍具有挑战性。本文探讨了 LLMs 如何生成 100% 有效的分子。我们评估了 LLMs 是否能够使用 SELFIES—a种每个字符串对应有效分子的表示——进行有效分子生成,但发现 LLMs 在 SELFIES 上表现不如 SMILES。随后,我们检查了 LLMs 纠正无效 SMILES 的能力,发现其能力有限。最后,我们提出 SmiSelf,一个用于无效 SMILES 纠正的跨化学语言框架。SmiSelf 将无效 SMILES 转换为 SELFIES,利用 SELFIES 的机制纠正无效 SMILES。实验表明,SmiSelf 确保 100% 的有效性,同时保持分子特性,并在其他指标上实现或提升性能。SmiSelf 帮助扩大了 LLMs 在生物医药领域的实际应用,并与所有基于 SMILES 的生成模型兼容。代码已提供,地址为 https://github.com/wentao228/SmiSelf。
引用
@article{arxiv.2509.23099,
title = {How to Make Large Language Models Generate 100% Valid Molecules?},
author = {Wen Tao and Jing Tang and Alvin Chan and Bryan Hooi and Baolong Bi and Nanyun Peng and Yuansheng Liu and Yiwei Wang},
journal= {arXiv preprint arXiv:2509.23099},
year = {2025}
}
备注
EMNLP 2025 Main