基于 DIONYSUS 的低数据化学数据集上概率模型的校准与泛化能力研究
计算工程、金融与科学
2022-12-07 v2 人工智能
摘要
利用大型数据集的深度学习模型在分子性质建模中常处于最先进水平(SOTA)。当数据集较小(< 2000 个分子)时,尚不清楚深度学习方法是否为合适的建模工具。本工作中,我们对小化学数据集上概率机器学习模型的校准与泛化能力进行了广泛研究。利用不同的分子表示与模型,我们分析其在多种任务(二分类、回归)与数据集上预测及不确定性的质量。我们还引入两项模拟实验以评估其性能:(1)贝叶斯优化引导的分子设计,(2)通过消融聚类划分的离群分布数据推断。我们就小化学数据集(新化学实验中的常见场景)建模的模型与特征选择提供了实用见解。我们将分析封装于 DIONYSUS 代码库,并已开源以促进可复现性并扩展至新数据集。
引用
@article{arxiv.2212.01574,
title = {Calibration and generalizability of probabilistic models on low-data chemical datasets with DIONYSUS},
author = {Gary Tom and Riley J. Hickman and Aniket Zinzuwadia and Afshan Mohajeri and Benjamin Sanchez-Lengeling and Alan Aspuru-Guzik},
journal= {arXiv preprint arXiv:2212.01574},
year = {2022}
}
备注
15+4 pages, 9+3 figures Comments: Fix author name typo in article and meta data