GeneMask:用于基因序列快速预训练以实现少样本学习的掩码方法
计算与语言
2023-10-16 v1
摘要
DNABert 和 LOGO 等大规模语言模型旨在学习最优基因表示,并在整个人类参考基因组上训练。然而,标准分词方案采用如 k-mer 这样的简单滑动窗口令牌,未利用任何基于基因的语义,因此可能导致对易预测序列的(平凡)掩码,进而造成掩码语言建模(MLM)训练低效。为此,我们提出一种用于基因序列 MLM 训练的新颖掩码算法 GeneMask,其中随机确定基因序列中的位置作为掩码中心,并在局部选取掩码中心周围具有最高归一化逐点互信息(NPMI)的片段进行掩码。我们观察到,在基因组学领域缺乏人类可理解的语义(相反,NLP 中天然存在词与短语等语义单元)的情况下,基于 GeneMask 的模型在四种基准基因序列分类数据集、五种少样本设定(10 至 1000 样本)下均大幅优于 SOTA 模型(DNABert 与 LOGO)。更显著的是,基于 GeneMask 的 DNABert 模型训练轮数不到原始 SOTA 模型的十分之一。我们还观察到排名靠前的 PMI 令牌与保守 DNA 序列基序之间存在强相关性,这可能表明潜在基因组信息的引入。代码(含训练模型)与数据集已公开于 https://github.com/roysoumya/GeneMask。
引用
@article{arxiv.2307.15933,
title = {GeneMask: Fast Pretraining of Gene Sequences to Enable Few-Shot Learning},
author = {Soumyadeep Roy and Jonas Wallat and Sowmya S Sundaram and Wolfgang Nejdl and Niloy Ganguly},
journal= {arXiv preprint arXiv:2307.15933},
year = {2023}
}
备注
12 pages including appendix. Accepted for publication at 26th European Conference on Artificial Intelligence ECAI 2023