中文

Wisteria:面向 DNA 语言模型的统一多尺度特征学习框架

人工智能 2026-05-08 v1

摘要

DNA 语言模型旨在通过捕捉 DNA 序列中长程依赖关系,解读基因组的调控语法与语义。现有方法强调长程 token 交互,却往往忽视局部 Motif 与全局依赖之间的相互作用。本文提出 Wisteria,一种集成多尺度特征学习于统一框架中的基因组语言模型,用于 DNA 序列。具体而言,Wisteria 采用带门控扩散卷积的 Mamba 架构,以捕捉局部 Motif 与调控模式,同时采用带门控的多层感知机 (MLP) 细化全局依赖。我们进一步引入基于傅里叶的注意力机制,支持频域建模、周期性扩展和长度泛化。在四种包含短程与长程依赖的实验设置中,Wisteria 在下游基准任务中优于竞争性的 DNA 语言模型基线。这些结果表明,Wisteria 有效地统一了局部与全局依赖建模,用于多尺度基因组序列分析。

关键词

引用

@article{arxiv.2605.05913,
  title  = {Wisteria: A Unified Multi-Scale Feature Learning Framework for DNA Language Model},
  author = {Weihua Wang and Haoji Li and Feilong Bao and Lei Yang and Guanglai Gao},
  journal= {arXiv preprint arXiv:2605.05913},
  year   = {2026}
}

备注

25 pages, 4 figures. Under review