JanusDNA:强大的双向混合DNA基础模型
机器学习
2025-10-29 v4 基因组学
摘要
大语言模型(LLMs)革新了自然语言处理,并越来越多地应用于其他序列数据类型,包括基因序列。然而,将LLMs适配到基因组学面临重大挑战。捕获复杂的基因组相互作用需要建模DNA序列中的长程依赖,其中相互作用通常跨越超过10,000个碱基对,即使在单个基因内也是如此,这在传统模型架构和训练范式下带来了巨大的计算负担。此外,标准的LLM训练方法对DNA而言并非最优:自回归训练虽然高效,但仅支持单向理解。然而,DNA本质上是双向的,例如双向启动子在两个方向上调控转录,并占人类基因表达的近11%。掩码语言模型(MLMs)允许双向理解,但效率低下,因为每步只有掩码标记贡献于损失。为了解决这些局限性,我们引入了JanusDNA,这是第一个基于新型预训练范式的双向DNA基础模型,该范式结合了自回归建模的优化效率与掩码建模的双向理解。JanusDNA采用混合Mamba、Attention和Mixture of Experts (MoE)架构,结合Attention的长程建模与Mamba的高效序列学习。MoE层通过稀疏激活进一步扩展模型容量,同时保持低计算成本。值得注意的是,JanusDNA在单个80GB GPU上以单核苷酸分辨率处理多达100万个碱基对。广泛的实验和消融研究表明,JanusDNA在三个基因组表示基准测试上取得了新的SOTA结果,其性能超越了激活参数多250倍的模型。代码:https://github.com/Qihao-Duan/JanusDNA
引用
@article{arxiv.2505.17257,
title = {JanusDNA: A Powerful Bi-directional Hybrid DNA Foundation Model},
author = {Qihao Duan and Bingding Huang and Zhenqiao Song and Irina Lehmann and Lei Gu and Roland Eils and Benjamin Wild},
journal= {arXiv preprint arXiv:2505.17257},
year = {2025}
}
备注
NeurIPS 2025