中文

利用压缩数据融合跨跃生物医学语境

机器学习 2017-08-14 v1 分子网络 机器学习

摘要

动机:多样化生物数据的快速增长使我们能够考虑各种对象之间的相互作用,例如基因、化学物质、分子特征、疾病、通路和环境暴露。通常,任意一对对象——例如基因和疾病——可以通过不同方式相关联,例如直接通过基因-疾病关联或间接通过功能注释、化学物质和通路。关联这些对象的不同方式承载着不同的语义。然而,传统方法忽略了这些语义,因此无法在数据建模中充分利用其价值。结果:我们提出了 Medusa,一种检测大小为 k 的对象模块的方法,这些模块聚合起来对另一组对象显得最为显著。Medusa 作用于大规模异构数据集合并明确区分不同的数据语义。它从两个维度推进了研究:它建立在集体矩阵分解的基础上来推导不同的语义,并将模块的增长表述为一个子模优化问题。Medusa 在选择或组合语义方面具有灵活性,并提供了关于检测质量的理论保证。在一项针对 310 种复杂疾病的系统研究中,我们展示了 Medusa 在将基因与疾病关联以及检测疾病模块方面的有效性。我们证明,在预测基因-疾病关联方面,Medusa 优于忽略不同语义的方法。我们发现不同语义的效用取决于疾病类别,并且总体而言,Medusa 在组合不同语义时能更准确地恢复疾病模块。

关键词

引用

@article{arxiv.1708.03392,
  title  = {Jumping across biomedical contexts using compressive data fusion},
  author = {Marinka Zitnik and Blaz Zupan},
  journal= {arXiv preprint arXiv:1708.03392},
  year   = {2017}
}

备注

In Proceedings of the 24th International Conference on Intelligent Systems for Molecular Biology (ISMB), 2016