基于层次文本反向推导的数据高效分子生成
机器学习
2024-07-17 v3 分子网络
摘要
在实际部署中,开发有效的分子生成框架往往需要 limited number of molecules,由于获取任务相关分子数据需要高昂且耗时的实验成本。为此,我们引入基于层次文本反向推导的分子生成 (HI-Mol),一种新型数据高效分子生成方法。HI-Mol 受层次信息(如粗粒度和细粒度特征)在理解分子分布中的重要性启发,提出使用多级嵌入反映此类层次特征,基于近期在视觉领域中实现数据高效图像生成的文本反向推导技术。与在图像领域使用单级 token 嵌入的常规文本反向推导方法相比,我们的多级 token 嵌入允许模型有效学习 underlying low-shot molecule distribution。随后,我们基于多级 token 嵌入的插值生成分子。大量实验表明,HI-Mol 在数据效率方面具有显著优势。例如,在 QM9 数据集上,HI-Mol 相比先前的 SOTA 方法使用 50 倍更少的训练数据即可取得优异性能。我们还展示了 HI-Mol 生成的分子在 low-shot 分子性质预测中的有效性。
引用
@article{arxiv.2405.02845,
title = {Data-Efficient Molecular Generation with Hierarchical Textual Inversion},
author = {Seojin Kim and Jaehyun Nam and Sihyun Yu and Younghoon Shin and Jinwoo Shin},
journal= {arXiv preprint arXiv:2405.02845},
year = {2024}
}
备注
ICML 2024