利用规则归纳方法预测转录因子与DNA的结合
摘要
DNA向mRNA的转录由若干转录因子(transcription factors, TFs)启动和辅助,这些蛋白质具有DNA结合区,可附着于DNA中的结合位点(转录因子结合位点,transcription factor binding sites, TFBSs)。由于TFs和TFBSs均高度可变已成为共识,需要工具来量化特定TF变体结合到特定TFBS所产生的相互作用强度。我们采用一种简单方法预测蛋白质与DNA的相互作用:给定文献中已量化两个序列间相互作用强度的实验案例,我们将每个氨基酸和核苷酸位置视为样例向量中的单一特征,从而为规则归纳构建训练向量。所得相互作用强度用作目标类别或值。这些训练向量随后用于建立规则归纳模型。我们将规则归纳方法应用于三个蛋白质家族——来自NF-kappaB、早期生长反应(early-growth-response, EGR)和配对域(paired domain)组的转录因子——及其对应的DNA靶标。这三个预测问题在模型构建上复杂性递增,从而为我们提供了良好的验证范围。本研究主要关注最复杂的问题:配对域-DNA结合。对此问题,我们还利用信息论度量发现了序列/结合强度相关性。预测结果普遍良好:规则归纳方法能够对所有九个未见过的NF-kappaB蛋白样例正确排序,在EGR案例中于未见(且含噪声)样例上达到0.52的相关系数,并通过交叉验证对配对域达到69.7%的分类准确率。
引用
@article{arxiv.q-bio/0505025,
title = {Prediction of transcription factor binding to DNA using rule induction methods},
author = {Mikael Huss and Karin Nordstrom},
journal= {arXiv preprint arXiv:q-bio/0505025},
year = {2007}
}
备注
v. 2: Added results on NF-kappaB and replaced EGR results (now a mean score is used as target value instead of a score from a single experiment as in v. 1); reworded and reformatted most of the manuscript