DNA 语言模型:面向微调任务的预训练评估
基因组学
2026-06-29 v1 计算与语言
摘要
基础模型和大型语言模型(LLMs)的最新突破为研究和解码基因组序列引入了新的机遇。一些最先进的方法,如 DNABERT2,依赖于基于 transformer 的架构,而其他方法,如 ConvNova,仍然建立在更传统的卷积模型之上。然而,对这些方法进行的系统性基准比较仍然很少。鉴于基于 transformer 的模型需要广泛且昂贵的预训练,评估其性能提升是否足以抵消这一开销至关重要。此外,诸如 DNABERT2 之类的 LLM 通常依赖于 Byte Pair Encoding (BPE) 分词,其对于 DNA 序列表示的相关性在基因组学界仍存在争议。在这项工作中,我们研究了三个关键问题: 基于 transformer 的模型在经过大量预训练后,是否在微调任务上提供了足够的改进; 在此设定下预训练的实际贡献是什么; BPE 分词如何影响基因组学相关任务的性能?
引用
@article{arxiv.2606.30140,
title = {DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks},
author = {Romain Karpinsky and Julien Mozziconacci and Mickaël Delcey},
journal= {arXiv preprint arXiv:2606.30140},
year = {2026}
}
备注
12 pages, 2 figures, 14 tables