基于字节配对编码和K-MER方法的DNA语言模型混合分词策略
计算与语言
2025-07-25 v1
摘要
本文提出了一种新颖的混合分词策略,通过将6-mer分词与字节配对编码(BPE-600)结合,提高DNA语言模型(DLM)的性能。传统的k-mer分词在捕获局部DNA序列结构方面有效,但常面临token分布不均和有限理解全局序列上下文的挑战。为解决这些限制,我们提出将唯一的6mer token与通过600次BPE循环生成的优化选择BPE token合并。这种混合方法确保了平衡且富有洞察力的词汇表,使模型能够同时捕获DNA序列中的短程和长程模式。对该混合词汇表进行基础DLM训练后,我们采用下一个k-mer预测作为微调任务进行评估,结果显示性能显著优于NT、DNABERT2和GROVER等最先进模型。该模型在3-mer预测准确率达到10.78%,4-mer预测准确率为10.1%,5-mer预测准确率为4.12%。这些结果凸显了混合分词策略在保留DNA建模中局部序列结构和全局上下文信息方面的能力。本工作强调了基因组语言建模中先进分词方法的重要性,为未来在下游DNA序列分析和生物学研究中奠定了坚实基础。
引用
@article{arxiv.2507.18570,
title = {Hybrid Tokenization Strategy for DNA Language Model using Byte Pair Encoding and K-MER Methods},
author = {Ganesh Sapkota and Md Hasibur Rahman},
journal= {arXiv preprint arXiv:2507.18570},
year = {2025}
}