关于预测化学信息学中未报告特征为负的假设
机器学习
2017-08-09 v3 化学物理
机器学习
摘要
在化学信息学中,化合物-靶点结合谱一直是研究的主要数据来源。对于仅提供阳性特征谱的数据存储库,一个普遍的假设是未报告的特征谱均为阴性。在本文中,我们提醒读者不要理所当然地接受这一假设,并从机器学习角度提出了其无效性的经验证据。我们的检查基于将结合特征谱用作训练预测模型的特征这一设定;我们表明(1)当该假设失效时,预测性能会下降;(2)显式恢复未报告的特征谱能提高预测性能。特别地,我们提出了一个联合恢复特征谱并学习预测模型的框架,并表明它能实现进一步的性能提升。本研究不仅建议应用矩阵恢复方法来恢复未报告的特征谱,还提出了一个新的缺失特征问题,我们称之为具有正特征与未知特征的学习。
引用
@article{arxiv.1704.01184,
title = {On the Unreported-Profile-is-Negative Assumption for Predictive Cheminformatics},
author = {Chao Lan and Sai Nivedita Chandrasekaran and Jun Huan},
journal= {arXiv preprint arXiv:1704.01184},
year = {2017}
}
备注
the quality of the current version is unsatisfactory. we decide to withdraw the manuscript. thank you