中文

PlantBiMoE:面向植物基因组的双向基础模型与稀疏MoE

机器学习 2025-12-09 v1 基因组学

摘要

理解植物基因组底层语言规则仍然是计算生物学中的一个基本挑战。最近包括 AgroNT 和 PDLLMs 在内的进展取得了显著进展,尽管它们分别存在参数规模过大和建模 DNA 链双向性质能力有限的问题。为解决这些局限性,我们提出了 PlantBiMoE,一个轻量且表达力强的植物基因组语言模型,它集成了双向 Mamba 和稀疏混合专家(SparseMoE)框架。双向 Mamba 使模型能够有效捕捉正向和反向 DNA 链之间的结构依赖关系,而 SparseMoE 显著减少了活跃参数数量,在不牺牲建模能力的情况下提高了计算效率。我们在改进的植物基因组基准(MPGB)上评估和测试了我们的模型,这是一个增强的基因组基准,整合了 31 个数据集,涵盖 11 个代表性任务,输入序列长度从 50 到 6,000 bp。实验结果表明,PlantBiMoE 在 31 个数据集中的 20 个上取得了最佳性能,在与现有模型比较时平均表现最佳。总之,上述所有结果表明我们的模型能够有效表示植物基因组序列,作为多样化基因组任务的稳健计算工具,为植物基因组学、基因编辑和合成生物学做出了实质性贡献。代码可在 https://github.com/HUST-Keep-Lin/PlantBiMoE 获取。

关键词

引用

@article{arxiv.2512.07113,
  title  = {PlantBiMoE: A Bidirectional Foundation Model with SparseMoE for Plant Genomes},
  author = {Kepeng Lin and Qizhe Zhang and Rui Wang and Xuehai Hu and Wei Xu},
  journal= {arXiv preprint arXiv:2512.07113},
  year   = {2025}
}

备注

6 pages, 5 figures, accept to BIBM