通过结合生物数据集模型迈向计算累积生物学
定量方法
2015-06-19 v1 基因组学
机器学习
摘要
数据驱动科学的一个主要挑战是如何充分利用不断扩展的实验数据集数据库,以保持研究的累积性。我们引入了一种基于建模的数据集检索引擎的概念,旨在将研究人员的实验数据集与该领域的早期工作联系起来。该搜索具有:(i) 数据驱动性,以超越注释中关键词搜索的现状从而实现新发现;(ii) 模型驱动性,以纳入生物学知识和从数据中学到的见解;(iii) 可扩展性,因为它无需构建所有数据的统一宏大模型即可完成。假设每个数据集事先已由研究人员或数据库管理者建模,我们应用一种可快速计算且可优化的组合模型,将新数据集分解为来自早期相关模型的贡献。利用这种数据驱动的分解,我们从大型注释人类基因表达图谱中识别出一个相互关联的数据集网络。虽然组织类型和疾病是确定相关数据集的主要驱动力,但发现的关系更为丰富,且基于模型的搜索比关键词搜索更准确;此外,它还恢复了从注释中不易直接看出的具有生物学意义的关系,例如不同发育阶段的细胞(如胸腺细胞和 T 细胞)之间的关系。数据驱动的链接与引用在很大程度上相匹配;数据驱动的链接甚至揭示了对出版数据的修正,因为两个链接最多的数据集并未被高度引用,且被发现数据库中的出版条目有误。
引用
@article{arxiv.1404.0329,
title = {Toward computational cumulative biology by combining models of biological datasets},
author = {Ali Faisal and Jaakko Peltonen and Elisabeth Georgii and Johan Rung and Samuel Kaski},
journal= {arXiv preprint arXiv:1404.0329},
year = {2015}
}