中文

利用具有字节级精度的编码器-解码器基础模型理解DNA的自然语言

机器学习 2024-08-26 v3 基因组学

摘要

本文提出集成核苷酸字节级编码器-解码器(ENBED)基础模型,采用编码器-解码器Transformer架构以字节级精度分析DNA序列。ENBED使用注意力的次二次实现来开发能够进行序列到序列转换的高效模型,推广了先前仅含编码器或仅含解码器架构的基因组模型。我们利用掩码语言建模(Masked Language Modeling)基于参考基因组序列预训练该基础模型,并将其应用于以下下游任务:(1)增强子、启动子和剪接位点的识别,(2)识别含有碱基调用错配与插入/缺失错误的序列,此能力优于涉及多个碱基对的分词方案(后者丧失字节级精度分析能力),(3)基因组序列生物功能注释的识别,以及(4)利用编码器-解码器架构生成流感病毒突变并对照真实世界观测进行验证。在各项任务中,我们均展现出相对于现有最先进结果的显著改进。

关键词

引用

@article{arxiv.2311.02333,
  title  = {Understanding the Natural Language of DNA using Encoder-Decoder Foundation Models with Byte-level Precision},
  author = {Aditya Malusare and Harish Kothandaraman and Dipesh Tamboli and Nadia A. Lanman and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2311.02333},
  year   = {2024}
}

备注

Accepted to OUP Bioinformatics Advances