t-SMILES:一种用于从头分子生成的可扩展基于片段的分子表示框架
机器学习
2024-05-22 v4 人工智能
生物大分子
摘要
分子的有效表示是影响人工智能模型性能的关键因素。本研究引入了一种灵活、基于片段、多尺度的分子表示框架,称为 t-SMILES(基于树的 SMILES),包含三种编码算法:TSSA、TSDY 和 TSID。它通过对由片段化分子图构成的完整二叉树进行广度优先搜索所获得的 SMILES 类型字符串来描述分子。使用 JTVAE、BRICS、MMPA 和 Scaffold 进行的系统评估表明,构建多编码分子描述系统是可行的,其中各种描述相互补充,提升了整体性能。此外,无论是在原始模型、数据增强模型,还是预训练后微调的模型中,它都能在标注低资源数据集上保持合理相似度的同时避免过拟合并获得更高的新颖性分数。而且,在目标导向任务中,它显著优于经典 SMILES、DeepSMILES、SELFIES 和基线模型。在 ChEMBL、Zinc 和 QM9 上,它也超越了最先进的基于片段、图和 SMILES 的方法。
引用
@article{arxiv.2301.01829,
title = {t-SMILES: A Scalable Fragment-based Molecular Representation Framework for De Novo Molecule Generation},
author = {Juan-Ni Wu and Tong Wang and Yue Chen and Li-Juan Tang and Hai-Long Wu and Ru-Qin Yu},
journal= {arXiv preprint arXiv:2301.01829},
year = {2024}
}