中文

面向变异效应的 SNP 感知 DNA 基础模型 BMFM-DNA

基因组学 2025-07-09 v1 机器学习

摘要

大型语言模型(LLM)在自然语言处理任务中取得了显著成果。这些模型已被改编用于解码 DNA 语言,其中核苷酸序列充当“单词”,编码基因组功能。然而,基因组与自然语言根本不同,缺乏明确定义的“单词”或一致的语法。尽管 DNA 语言模型(DNALMs)如 DNABERT、GENA-LM 在基因组相关生物任务中取得高水平性能,但这些模型未能在序列变异存在的情况下编码生物功能。为此,我们预训练了整合序列变异(特别是单核苷酸多态性,SNP)的基础模型。具体而言,我们使用 ModernBERT 预训练两种不同的生物医学基础模型(BMFM),即 BMFM-DNA-REF,该模型在来自参考基因组的可变长度序列及其反向互补序列上进行训练;以及 BMFM-DNA-SNP,该模型使用一种新颖表示方案对包含序列变异的序列进行训练。我们的发现表明,将序列变异整合到 DNALMs 中有助于捕捉生物功能,在所有微调任务中均取得性能提升。为探索模型的实际用途,我们对 various SNP imputation 在 DNABERT-2 引入的 promoter 检测任务进行实验。然而,我们认识到当前基准在完全评估这些模型方面存在局限。为未来更全面的评估并鼓励社区贡献,我们通过 HuggingFace 发布我们的模型,并在 https://github.com/BiomedSciAI/biomed-multi-omic 提供复现结果的代码。

关键词

引用

@article{arxiv.2507.05265,
  title  = {BMFM-DNA: A SNP-aware DNA foundation model to capture variant effects},
  author = {Hongyang Li and Sanjoy Dey and Bum Chul Kwon and Michael Danziger and Michal Rosen-Tzvi and Jianying Hu and James Kozloski and Ching-Huei Tsou and Bharath Dandala and Pablo Meyer},
  journal= {arXiv preprint arXiv:2507.05265},
  year   = {2025}
}