中文

用于跨上下文 DNA-蛋白质结合预测的迁移字符串核

机器学习 2016-11-17 v1

摘要

通过基于序列的分类,本文试图在未注释的细胞上下文中准确预测转录因子的 DNA 结合位点。文献中的现有方法无法准确进行此类预测,因为它们没有考虑序列片段从已注释(源)上下文到未注释(目标)上下文的样本分布偏移。因此,我们提出了一种名为“迁移字符串核”(TSK)的方法,该方法通过跨上下文样本适应进行知识迁移,从而改进转录因子结合位点的预测。TSK 使用判别式错配字符串核框架将序列片段映射到高维特征空间。在此高维空间中,对源上下文的标注样本进行重新加权,以使修正后的样本分布更紧密地匹配目标上下文。我们在跨物种设置下,针对十四种不同转录因子的 TFBS 识别实验验证了 TSK。我们发现 TSK 始终优于当前最先进的 TFBS 工具,特别是在处理结合序列在不同上下文中不保守的转录因子时。我们还通过展示 TSK 在 MHC 肽结合预测的一组不同跨上下文任务上的前沿性能,证明了 TSK 的泛化能力。

关键词

引用

@article{arxiv.1609.03490,
  title  = {Transfer String Kernel for Cross-Context DNA-Protein Binding Prediction},
  author = {Ritambhara Singh and Jack Lanchantin and Gabriel Robins and Yanjun Qi},
  journal= {arXiv preprint arXiv:1609.03490},
  year   = {2016}
}

备注

To be published in IEEE/ACM Transactions on Computational Biology and Bioinformatics