寻找失落的 DNA 序列预训练
机器学习
2026-04-21 v1 人工智能
摘要
DNA 序列编码是基因功能预测、蛋白质合成以及多样下游生物学任务的基础。尽管大规模 DNA 序列预训练已取得显著进展,但现有研究几乎都侧重于预训练规模和自定义下游评估数据集,而忽略了预训练范式的一些关键组成部分。本文揭示了 DNA 预训练中三个 critical 且此前被忽视的问题:不合适的下游数据集、邻居掩码策略中的内在缺陷以及词汇表讨论的不足。因此,我们进行了全面的调查工作,提出原则性指南,包括评估数据集的选择准则、指导任务设计以及深入词汇表分析。大量实验验证了我们识别问题的重要性,并支持我们建议的理由。最后,我们引入了一个标准化的测试平台,enable 可复制且严谨的 DNA 预训练方法基准测试,以推动基因组基础模型的发展。
引用
@article{arxiv.2604.16570,
title = {In Search of Lost DNA Sequence Pretraining},
author = {Zhijiang Tang and Jiaxin Qi and Yan Cui and Jinli Ou and Yuhua Zheng and Jianqiang Huang},
journal= {arXiv preprint arXiv:2604.16570},
year = {2026}
}