理解面向 DNA 基础模型的类 BERT 预训练
人工智能
2024-09-10 v3 计算与语言
机器学习
摘要
随着大规模预训练在语言任务中的成功,将其应用于生命科学领域的趋势日益增长。特别是,基于 DNA 序列的预训练方法因有望捕获关于基因的通用信息而受到越来越多的关注。然而,现有的 DNA 序列预训练方法很大程度上依赖直接从 NLP 沿用 BERT 预训练,缺乏全面理解和针对性定制方法。为填补这一研究空白,我们提供了首个包含三个深刻观察的实证研究。基于该实证研究,我们注意到重叠分词器有利于下游任务的微调,但会导致预训练不足且收敛迅速。为释放预训练潜力,我们引入了一种称为 RandomMask 的新方法,其通过持续扩展掩码边界逐步增加类 BERT 预训练的任务难度,迫使模型学习更多知识。RandomMask 简单而有效,在 6 个下游任务上取得了最先进的性能。RandomMask 在表观遗传标记预测上的 Matthew 相关系数达到了惊人的 68.16%,较基线大幅增长 19.85%,并较先前最先进结果显著提升 3.69%。
引用
@article{arxiv.2310.07644,
title = {Toward Understanding BERT-Like Pre-Training for DNA Foundation Models},
author = {Chaoqi Liang and Lifeng Qiao and Peng Ye and Nanqing Dong and Jianle Sun and Weiqiang Bai and Yuchen Ren and Xinzhu Ma and Hongliang Yan and Chunfeng Song and Wanli Ouyang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2310.07644},
year = {2024}
}