中文

EvoLen:进化引导的 DNA 语言模型分词

机器学习 2026-04-13 v1 基因组学

摘要

标记是 DNA 语言模型 (DNALMs) 中表示单元的基本单位,但其设计仍未得到充分探索。与自然语言不同,DNA lacks 固有的标记边界或预定义的组成规则,这使分词成为一种基本建模决策,而非自然指定的选项。虽然现有方法如字节对编码 (BPE) 在捕获反映人类生成语言规律性的标记结构方面表现出色,但 DNA 是以生物功能和进化约束组织的,而非语言惯例。我们认为,DNA 分词应优先考虑功能序列模式,如调控基序—在进化约束下保持短暂且反复出现的片段,通常在物种间得到保护。我们通过 EvoLen 将进化信息直接整合到分词过程中,该方法结合进化分层与长度感知解码,以更好地保留基序尺度的功能序列单元。EvoLen 使用跨种群的进化信号对 DNA 序列进行分组,在每组上训练独立的 BPE 分词器,通过优先保留保护模式的规则合并所得词汇表,并应用长度感知解码与动态规划。通过受控实验,EvoLen 在保持功能序列模式、跨基因组背景区分度以及与进化约束的对齐方面均取得改善,同时在 diverse DNALM 基准中与标准 BPE 相当或更好。这些结果表明,分词引入了关键的归纳偏置,纳入进化信息可获得更具生物学意义和可解释性的序列表示。

关键词

引用

@article{arxiv.2604.08698,
  title  = {EvoLen: Evolution-Guided Tokenization for DNA Language Model},
  author = {Nan Huang and Xiaoxiao Zhou and Junxia Cui and Mario Tapia-Pacheco and Tiffany Amariuta and Yang Li and Jingbo Shang},
  journal= {arXiv preprint arXiv:2604.08698},
  year   = {2026}
}