中文

重复元素如何驱动词汇表:基于 T2T 原猴基因组的字节配对编码分析

基因组学 2025-05-15 v1 人工智能

摘要

端粒到端粒(T2T)基因组组装的出现为比较基因组学开辟了新的研究方向,但针对基因序列的有效分词策略仍未得到充分探索。本研究应用字节配对编码(BPE)对包括三组人类基因组在内的九个 T2T 原猴基因组进行分析,通过训练独立的 BPE 分词器并使用固定词汇量为 512,000 的 token,使用我们自开发的工具 dnaBPE。我们的分析显示,仅有 11,569 个 token 在所有组装中共享,而 nearly 991,854 个 token 仅存在于单个基因组中,表明随着组装比较数量的增加,共享词汇量迅速下降。此外,来自 token 重叠度的 phylogenetic 树未能复现已知的原猴关系,这一差异归因于种类特异的高拷贝重复元素所占比例过大。这些发现凸显了 BPE 分词的双重性质:虽然它有效地压缩了重复序列,但其对高拷贝元素的敏感性限制了其作为通用比较基因组学工具的实用性。我们讨论了潜在的混合策略和重复掩码方法,以细化基因分词,强调在大规模基因组语言模型开发中需要针对特定领域进行适应。本研究中使用的 dnaBPE 工具已开源发布,地址为 https://github.com/aglabx/dnaBPE。

关键词

引用

@article{arxiv.2505.08918,
  title  = {When repeats drive the vocabulary: a Byte-Pair Encoding analysis of T2T primate genomes},
  author = {Marina Popova and Iaroslav Chelombitko and Aleksey Komissarov},
  journal= {arXiv preprint arXiv:2505.08918},
  year   = {2025}
}

备注

ICLR 2025 Workshop on Machine Learning for Genomics Explorations