中文

基于字节配对编码和K-MER方法的DNA语言模型混合分词策略

计算与语言 2025-07-25 v1

摘要

本文提出了一种新颖的混合分词策略,通过将6-mer分词与字节配对编码(BPE-600)结合,提高DNA语言模型(DLM)的性能。传统的k-mer分词在捕获局部DNA序列结构方面有效,但常面临token分布不均和有限理解全局序列上下文的挑战。为解决这些限制,我们提出将唯一的6mer token与通过600次BPE循环生成的优化选择BPE token合并。这种混合方法确保了平衡且富有洞察力的词汇表,使模型能够同时捕获DNA序列中的短程和长程模式。对该混合词汇表进行基础DLM训练后,我们采用下一个k-mer预测作为微调任务进行评估,结果显示性能显著优于NT、DNABERT2和GROVER等最先进模型。该模型在3-mer预测准确率达到10.78%,4-mer预测准确率为10.1%,5-mer预测准确率为4.12%。这些结果凸显了混合分词策略在保留DNA建模中局部序列结构和全局上下文信息方面的能力。本工作强调了基因组语言建模中先进分词方法的重要性,为未来在下游DNA序列分析和生物学研究中奠定了坚实基础。

关键词

引用

@article{arxiv.2507.18570,
  title  = {Hybrid Tokenization Strategy for DNA Language Model using Byte Pair Encoding and K-MER Methods},
  author = {Ganesh Sapkota and Md Hasibur Rahman},
  journal= {arXiv preprint arXiv:2507.18570},
  year   = {2025}
}