通过SMILES解析提升LLM在化学领域的理解能力
机器学习
2025-05-23 v1
摘要
大型语言模型 (LLM) 正在被广泛认可为科学发现的强大工具,尤其是在分子科学领域。这些模型的一个基本要求是能够准确理解分子结构,通常以SMILES表示形式编码。然而,当前的LLM在解释SMILES方面存在困难,甚至无法完成诸如计数分子环等基础任务。为此,我们引入CLEANMOL,一个新型框架,将SMILES解析形式化为一套干净且确定性的任务,旨在促进图级别的分子理解。这些任务涵盖从子图匹配到全局图匹配,提供与分子结构属性相匹配的结构化监督。我们构建了一个带有自适应难度评分的分子预训练数据集,并在这些任务上对开源LLM进行预训练。我们的结果表明,CLEANMOL不仅提升了结构理解能力,也在Mol-Instructions基准上取得最佳或与基线相当的成绩。
引用
@article{arxiv.2505.16340,
title = {Improving Chemical Understanding of LLMs via SMILES Parsing},
author = {Yunhui Jang and Jaehyung Kim and Sungsoo Ahn},
journal= {arXiv preprint arXiv:2505.16340},
year = {2025}
}