用于机器学习分子性质预测前数据融合的独立向量分析
机器学习
2018-11-05 v1 材料科学
机器学习
摘要
与 ab-initio 量子化学和力场建模相比,由于计算速度快且精度高,利用机器学习预测分子性质在材料设计与药物发现领域备受关注。机器学习所需的一个主要成分是包含分子特征的训练数据集——例如指纹位、化学描述符等,能充分刻画相应分子。然而,针对任何应用选择特征都极为不易。不存在“通用”的特征选择方法。本工作中,我们提出一种数据融合框架,利用独立向量分析(Independent Vector Analysis, IVA)挖掘不同分子特征化方法中所含的互补信息,使我们向自动化特征生成迈进一步。我们的方法接受任意数量的独立特征向量,并自动生成单一、紧凑(低维)的分子特征集合,可用于提升回归模型的预测性能。同时,我们的方法保留了阐释所生成特征以发现分子结构与性质之间关系的可能性。我们在 QM7b 数据集上展示了这一点,用于预测多种性质,如原子化能、极化率、前沿轨道本征值、电离势、电子亲和势与激发能。此外,我们展示了该方法如何帮助提升对一组人 BACE-1 抑制剂实验结合亲和力的预测。为推广 IVA 的更广泛应用,我们开发了 PyIVA Python 包,这是一个开源代码,可在 Github 上下载。
引用
@article{arxiv.1811.00628,
title = {Independent Vector Analysis for Data Fusion Prior to Molecular Property Prediction with Machine Learning},
author = {Zois Boukouvalas and Daniel C. Elton and Peter W. Chung and Mark D. Fuge},
journal= {arXiv preprint arXiv:1811.00628},
year = {2018}
}