BarcodeMamba:用于生物多样性分析的状态空间模型
机器学习
2024-12-17 v1 基因组学
定量方法
摘要
DNA条形码在生物多样性分析中至关重要,用于构建自动识别系统,以识别已知物种并发现未知物种。与人类基因组建模不同,基于条形码的无脊椎动物识别在物种多样性和分类复杂性方面面临挑战。在基于Transformer的基础模型中,BarcodeBERT在无脊椎动物的物种级识别中表现出色,突显了在条形码特定数据集上进行自监督预训练的有效性。最近,结构化状态空间模型(SSM)出现,其时间复杂度随上下文长度呈次二次方缩放。与基于注意力的架构相比,SSM提供了序列建模的高效参数化。鉴于Mamba和Mamba-2在自然语言中的成功,我们设计了BarcodeMamba,一个用于生物多样性分析中DNA条形码的高性能高效基础模型。我们对自监督训练和分词方法的影响进行了全面的消融研究,并比较了两种Mamba层在表达能力和识别训练中未见的“新物种”方面的能力。我们的研究表明,即使仅使用8.3%的参数,BarcodeMamba的性能也优于BarcodeBERT,并且在无需微调的线性探测中,对“已知”物种的物种级准确率提高到99.2%。在我们的扩展研究中,使用BarcodeBERT参数的63.6%的BarcodeMamba,在1-最近邻(1-NN)探测中,对未知物种的属级准确率达到70.2%。重现我们实验的代码仓库可在https://github.com/bioscan-ml/BarcodeMamba获取。
引用
@article{arxiv.2412.11084,
title = {BarcodeMamba: State Space Models for Biodiversity Analysis},
author = {Tiancheng Gao and Graham W. Taylor},
journal= {arXiv preprint arXiv:2412.11084},
year = {2024}
}
备注
9 pages, 2 figures, accepted at Foundation Models for Science: Progress, Opportunities, and Challenges Workshop (NeurIPS 2024)