通过基因调控的预测性建模进行基序发现
基因组学
2007-05-23 v1
摘要
我们提出MEDUSA,一种通过整合启动子序列和基因表达数据来学习转录因子结合位点基序模型的集成方法。我们使用基于boosting的现代大间隔机器学习方法,从高维候选结合序列搜索空间中进行特征选择,同时避免过拟合。在算法的每次迭代中,MEDUSA构建一个基序模型,该模型在基因启动子区域中的存在,加上实验中调节因子的活性,可预测差异表达。通过这种方式,我们学习到具有功能性和可预测调控响应的基序,而非仅仅在启动子序列中过度代表的基序。此外,MEDUSA产生一个转录控制逻辑模型,给定目标基因启动子区域的序列和一组已知或推定的转录因子及信号分子的表达状态,可预测生物体中任何基因的表达。每个基序模型要么是一个长度序列、一个二聚体,要么是一个通过对具有相似boosting损失的序列进行凝聚式概率聚类构建的PSSM。通过将MEDUSA应用于酵母中的一组环境应激响应表达数据,我们学习到的基序预测靶基因差异表达的能力优于来自TRANSFAC数据集和先前发表的候选PSSM集的基序。我们还表明MEDUSA从文献中检索到了许多与环境应激响应相关的实验证实的结合位点。
引用
@article{arxiv.q-bio/0701021,
title = {Motif Discovery through Predictive Modeling of Gene Regulation},
author = {Manuel Middendorf and Anshul Kundaje and Mihir Shah and Yoav Freund and Chris H. Wiggins and Christina Leslie},
journal= {arXiv preprint arXiv:q-bio/0701021},
year = {2007}
}
备注
RECOMB 2005