中文

由 Cerebras 提供支持的表观基因组语言模型

机器学习 2021-12-15 v1 基因组学

摘要

基于 Transformer 语言模型的大规模自监督预训练推动了自然语言处理领域的发展,并展现出向蛋白质与 DNA 这些生物“语言”跨应用的潜力。利用大型基因组序列语料学习 DNA 序列的有效表征,可通过迁移学习加速基因调控与功能模型的开发。然而,要准确建模细胞类型特异性的基因调控与功能,不仅需要考虑 DNA 核苷酸序列中承载的信息(该信息在细胞类型间基本不变),还需考虑染色体局部的“表观遗传状态”化学与结构特征如何随细胞类型变化。在此,我们提出一种基于 DNA 序列与配对表观遗传状态输入来学习表征的双向编码器来自 Transformer 的表征(BERT)模型,称之为表观基因组 BERT(Epigenomic BERT,或 EBERT)。我们以掩码语言模型为目标,在整个基因组及 127 种细胞类型上预训练 EBERT。借助与 Cerebras Systems 的合作,其 CS-1 系统支撑了全部预训练实验,使得这一此前因数据集过大而难以训练的复杂模型首次得以训练。我们通过在细胞类型特异性的转录因子结合预测任务上展现强劲性能,证明了 EBERT 的迁移学习潜力。在 ENCODE-DREAM 基准的 13 个评估数据集中,我们微调后的模型在 4 个上超越当前最优(state of the art)性能,并在挑战排行榜上取得第 3 名的综合排名。我们探究了表观遗传数据的引入与任务特定特征增强如何影响迁移学习性能。

关键词

引用

@article{arxiv.2112.07571,
  title  = {Epigenomic language models powered by Cerebras},
  author = {Meredith V. Trotter and Cuong Q. Nguyen and Stephen Young and Rob T. Woodruff and Kim M. Branson},
  journal= {arXiv preprint arXiv:2112.07571},
  year   = {2021}
}

备注

18 pages, 5 figures, 3 tables