中文

基于嵌入匹配的基因组模型蒸馏:用于 mRNA 表征学习的高效方法

机器学习 2026-04-13 v1 人工智能

摘要

大型基因组基础模型最近取得了显著的成果和体内翻译能力。然而,这些模型快速增长到数十亿参数,在计算资源受限时运行成本高昂。为克服这一挑战,我们提出了一个将最先进的基因组基础模型中的 mRNA 表征蒸馏到专为 mRNA 序列设计的小型模型的蒸馏框架,规模缩小 200 倍。我们发现,基于嵌入的蒸馏比基于逻辑的蒸馏方法更有效后者发现不稳定。基准测试在 mRNA-bench 上表明,蒸馏模型在规模相当的模型中实现了最先进的性能,并与更大的体系结构在 mRNA 相关任务中展开竞争。我们的结果突显了 mRNA 序列嵌入式蒸馏作为生物学基础模型有效训练策略的作用。这使得在基因组学中尤其是在大型模型计算困难或不可行时,实现类似的高效和可扩展序列建模成为可能。

关键词

引用

@article{arxiv.2604.08574,
  title  = {Distilling Genomic Models for Efficient mRNA Representation Learning via Embedding Matching},
  author = {Rasched Haidari and Sam Martin and Maxime Allard},
  journal= {arXiv preprint arXiv:2604.08574},
  year   = {2026}
}

备注

Accepted at the Tiny Papers Track for the Machine Learning for Genomics Explorations Workshop at ICLR 2026 an the Gen2 Workshop at ICLR 2026