中文

BioReason:在DNA-LLM模型中激励多模态生物推理

机器学习 2025-10-27 v2

摘要

从复杂的基因组数据中解锁深入且可解释的生物推理仍然是限制科学进步的重大AI挑战。尽管当前的DNA基础模型擅长表示序列,但它们在多步推理方面存在困难,且缺乏透明、具有生物学意义的解释。BioReason通过将DNA基础模型与大语言模型(LLM)紧密集成来解决这一问题,使LLM能够直接解释并对基因组信息进行推理。通过监督微调与强化学习,BioReason学会了产生合乎逻辑且生物学连贯的推论。它取得了显著的性能提升,将基于KEGG的疾病通路预测准确率从86%提高到98%,并在强基线上平均提升了15%的变异效应预测。BioReason能够对未见的生物实体进行推理,并逐步解释其决策,为生物学中可解释的机制性AI提供了一个变革性框架。所有数据、代码和检查点均可在 https://github.com/bowang-lab/BioReason 获取。

关键词

引用

@article{arxiv.2505.23579,
  title  = {BioReason: Incentivizing Multimodal Biological Reasoning within a DNA-LLM Model},
  author = {Adibvafa Fallahpour and Andrew Magnuson and Purav Gupta and Shihao Ma and Jack Naimer and Arnav Shah and Haonan Duan and Omar Ibrahim and Hani Goodarzi and Chris J. Maddison and Bo Wang},
  journal= {arXiv preprint arXiv:2505.23579},
  year   = {2025}
}

备注

28 pages, 4 figures, 4 tables