中文

JEPA-DNA:通过联合嵌入预测架构将基因组基础模型对齐

人工智能 2026-05-26 v2 基因组学

摘要

基因组基础模型(GFMs)通常依赖遮蔽语言建模(MLM)或下一标记预测(NTP)来学习“自然法则”。虽然这些生成式范式在捕获局部语法方面有效,但优先级在标记级重构,而非高层功能语境。我们引入JEPA-DNA,一个模型中立的持续训练框架,将联合嵌入预测架构(JEPA)与传统生成目标集成。通过对全局序列嵌入在潜在空间中进行监督,JEPA-DNA迫使模型预测被遮蔽基因组片段的功能表示,将学习信号从标记恢复转向语义对齐。我们在17项多样化基因组基准任务上评估JEPA-DNA,证明无论底层GFMs架构或生成目标如何,线性探测和零样性能都一致提升。我们的框架为GFMs树立了新最佳成绩,通过生成精度与潜在语义 grounding 之间的桥梁实现。通过大量消融研究,我们进一步刻画了生成目标与潜在目标之间的协同作用。我们的代码已公开于 https://github.com/NVIDIA-Digital-Bio/JEPA-DNA。

关键词

引用

@article{arxiv.2602.17162,
  title  = {JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures},
  author = {Ariel Larey and Elay Dahan and Amit Bleiweiss and Raizy Kellerman and Guy Leib and Omri Nayshool and Dan Ofer and Tal Zinger and Dan Dominissini and Gideon Rechavi and Nicole Bussola and Simon Lee and Shane O'Connell and Dung Hoang and Marissa Wirth and Alexander W. Charney and Nati Daniel and Yoli Shavit},
  journal= {arXiv preprint arXiv:2602.17162},
  year   = {2026}
}