大语言模型下的小分子优化
机器学习
2024-07-29 v1 神经与进化计算
定量方法
摘要
近期大语言模型的进展为生成式分子药物设计开辟了新的可能性。我们提出了 Chemlactica 和 Chemma 两个在由 1100 万分子及其计算属性构成的 400 亿 token 新语料库上微调的语言模型。这两个模型在生成具有指定属性的分子以及从有限样本预测新分子特征方面表现出色。我们引入了一种新型优化算法,利用这些语言模型对给定有限黑盒 oracle 的任意属性进行分子优化。该方法结合了遗传算法、拒绝抽样和提示优化的思想。在多个分子优化基准测试中实现了领先性能,其中在 Practical Molecular Optimization 上相较于先前方法提升了 8%。我们公开了训练语料库、语言模型以及优化算法。
引用
@article{arxiv.2407.18897,
title = {Small Molecule Optimization with Large Language Models},
author = {Philipp Guevorguian and Menua Bedrosian and Tigran Fahradyan and Gayane Chilingaryan and Hrant Khachatrian and Armen Aghajanyan},
journal= {arXiv preprint arXiv:2407.18897},
year = {2024}
}