基于 Transformer 的基因序列建模编码方案评估
计算与语言
2025-07-22 v1 人工智能
摘要
目前许多研究将 DNA 序列视为一种特殊类型的语言,并利用 Transformer 对其进行建模。这些研究使用固定长度的 k-mer 分段和 BPE 子词分词,但缺乏系统性评估来确定哪一种方案更优。我们比较了 k-mer 分段(k=1,3,4,5,6)、4,096 词元的 BPE 词汇表,以及三种位置编码方法(正弦、AliBi 和 RoPE)。每个配置在 3、6、12 和 24 层的 Transformer 编码器中从头训练,并在 GUE 数据集上进行评估。总体而言,BPE 在各任务中提供更高且更稳定的性能,通过将频繁的序列 motifs 压缩为可变长度词元来缩短序列长度,并提高模型的泛化能力。RoPE 在捕捉周期性 motifs 和对长序列的外推方面表现突出,而 AliBi 在由局部依赖驱动的任务上也表现良好。就深度而言,我们发现从 3 层增加到 12 层可获得显著提升,而在 24 层仅见轻微改进或轻微过拟合。该研究为设计 DNA Transformer 模型的分词和位置编码提供了实用指导。
关键词
引用
@article{arxiv.2507.15087,
title = {Evaluation of Coding Schemes for Transformer-based Gene Sequence Modeling},
author = {Chenlei Gong and Yuanhe Tian and Lei Mao and Yan Song},
journal= {arXiv preprint arXiv:2507.15087},
year = {2025}
}