面向大规模多标签基因组序列分类的原型匹配网络
机器学习
2017-11-13 v2 人工智能
机器学习
摘要
理解基因组学的基本任务之一是预测转录因子结合位点(TFBSs)。由于有数百个转录因子(TFs)作为标签,基于基因组序列的 TFBS 预测是一项具有挑战性的多标签分类任务。TF 结合有两种主要的生物学机制:(1)基因组上被称为“基序(motif)”的序列特异性结合模式;(2)被称为共结合效应的 TF 之间的相互作用。在本文中,我们提出了一种新颖的深度架构——原型匹配网络(PMN),以模拟 TF 结合机制。我们的 PMN 模型通过一种新颖的原型匹配损失为每个 TF 自动提取原型(“基序”类特征)。借鉴少样本匹配模型的思想,我们使用原型支撑集(support set)的概念和一个 LSTM 来学习 TF 如何相互作用并绑定到基因组序列。在一个包含 基因组序列的参考 TFBS 数据集上,PMN 显著优于基线方法,并从经验上验证了我们的设计选择。据我们所知,这是首个引入原型学习并考虑 TF-TF 相互作用用于大规模 TFBS 预测的深度学习的架构。所提出的架构不仅准确,而且对所涉及的底层生物学进行了建模。
引用
@article{arxiv.1710.11238,
title = {Prototype Matching Networks for Large-Scale Multi-label Genomic Sequence Classification},
author = {Jack Lanchantin and Arshdeep Sekhon and Ritambhara Singh and Yanjun Qi},
journal= {arXiv preprint arXiv:1710.11238},
year = {2017}
}
备注
15 pages, 6 figures, 5 tables