用于跨上下文 DNA-蛋白质结合预测的迁移字符串核
机器学习
2016-11-17 v1
摘要
通过基于序列的分类,本文试图在未注释的细胞上下文中准确预测转录因子的 DNA 结合位点。文献中的现有方法无法准确进行此类预测,因为它们没有考虑序列片段从已注释(源)上下文到未注释(目标)上下文的样本分布偏移。因此,我们提出了一种名为“迁移字符串核”(TSK)的方法,该方法通过跨上下文样本适应进行知识迁移,从而改进转录因子结合位点的预测。TSK 使用判别式错配字符串核框架将序列片段映射到高维特征空间。在此高维空间中,对源上下文的标注样本进行重新加权,以使修正后的样本分布更紧密地匹配目标上下文。我们在跨物种设置下,针对十四种不同转录因子的 TFBS 识别实验验证了 TSK。我们发现 TSK 始终优于当前最先进的 TFBS 工具,特别是在处理结合序列在不同上下文中不保守的转录因子时。我们还通过展示 TSK 在 MHC 肽结合预测的一组不同跨上下文任务上的前沿性能,证明了 TSK 的泛化能力。
引用
@article{arxiv.1609.03490,
title = {Transfer String Kernel for Cross-Context DNA-Protein Binding Prediction},
author = {Ritambhara Singh and Jack Lanchantin and Gabriel Robins and Yanjun Qi},
journal= {arXiv preprint arXiv:1609.03490},
year = {2016}
}
备注
To be published in IEEE/ACM Transactions on Computational Biology and Bioinformatics