中文

增强 DNA 基础模型以解决掩码建模效率问题

机器学习 2025-02-26 v1

摘要

掩码语言建模(MLM)作为预训练目标已被广泛用于基因组序列建模。虽然预训练模型可以成功充当各种下游任务的编码器,但预训练与推理之间的分布偏移会损害性能,因为预训练任务是将 [MASK] 令牌映射到预测,而在下游应用中 [MASK] 并不存在。这意味着编码器不会优先考虑其对非 [MASK] 令牌的编码,并且在仅与 MLM 任务相关的计算和参数上耗费资源,而这些在部署时是无关的。在这项工作中,我们提出了一种基于掩码自编码器框架的修改版编码器-解码器架构,旨在解决这种低效问题,该架构基于 BERT Transformer。我们从经验上证明,这种不匹配在基因组流水线中尤为有害,因为模型通常用于特征提取而无需微调。我们在 BIOSCAN-5M 数据集上评估了我们的方法,该数据集包含超过 200 万个独特的 DNA 条形码。与使用 MLM 任务预训练的因果模型和双向架构相比,我们在封闭世界和开放世界分类任务中均取得了显著的性能提升。

关键词

引用

@article{arxiv.2502.18405,
  title  = {Enhancing DNA Foundation Models to Address Masking Inefficiencies},
  author = {Monireh Safari and Pablo Millan Arias and Scott C. Lowe and Lila Kari and Angel X. Chang and Graham W. Taylor},
  journal= {arXiv preprint arXiv:2502.18405},
  year   = {2025}
}

备注

10 pages, 5 figures