VQDNA: 释放向量量化在多物种基因组序列建模中的潜力
基因组学
2024-06-04 v2 人工智能
摘要
类似于自然语言模型,预训练基因组语言模型被提出以通过无监督序列建模捕捉基因组内的潜在复杂性。它们已成为生物学研究人员和从业者不可或缺的工具。然而,这些模型中使用的人工设计分词策略可能无法从基因组数据有限的词表中编码出最具区分性的模式。本文引入了 VQDNA,一个从基因组词表学习角度革新基因组分词的通用框架。通过利用向量量化码本作为可学习词表,VQDNA 能够以端到端的方式自适应地将基因组分词为模式感知嵌入。为进一步突破其极限,我们提出了分层残差量化(HRQ),其中将不同尺度的码本按层次结构设计,以由粗到细的方式丰富基因组词表。在 32 个基因组数据集上的大量实验表明,与现有基因组语言模型相比,VQDNA 具有优越性和良好的参数效率。值得注意的是,对 SARS-CoV-2 突变的经验分析揭示了所学到的 HRQ 词表的细粒度模式感知能力及生物学意义,凸显了其在基因组学更广泛应用中尚未开发的潜力。
引用
@article{arxiv.2405.10812,
title = {VQDNA: Unleashing the Power of Vector Quantization for Multi-Species Genomic Sequence Modeling},
author = {Siyuan Li and Zedong Wang and Zicheng Liu and Di Wu and Cheng Tan and Jiangbin Zheng and Yufei Huang and Stan Z. Li},
journal= {arXiv preprint arXiv:2405.10812},
year = {2024}
}
备注
ICML 2024. Preprint V2 with 17 pages and 5 figures