中文

序列长度提升并非全部:基因表达预测中多模态信号的有效集成

机器学习 2026-03-13 v2 基因组学

摘要

基因表达预测,即从 DNA 序列预测 mRNA 表达水平,具有显著挑战性。先前的工作常侧重于延长输入序列长度以定位远端增强子,这些增强子可数百 kb 远距离影响靶基因。我们的工作首先揭示,对于当前模型而言,长序列建模可能降低性能。即便是经过精心设计的算法,也只能缓解由长序列引起的性能下降。相反,我们发现,靠近靶基因的近端多模态表观基因组信号更为关键。因此,我们关注如何更好地集成这些信号,这一问题长期被忽视。我们发现,不同的信号类型发挥着各自的生物学作用,其中一些直接标记活跃的调控元件,而另一些则反映背景染色质模式,可能引入混淆效应。简单的拼接可能导致模型与这些背景模式 develop 出 spurious 关联。为此,我们提出 Prism 框架,该框架学习多个高维表观基因组特征的组合,以代表不同的背景染色质状态,并使用背门调整以减轻混淆效应。我们的实验结果表明,正确建模多模态表观基因组信号即可仅使用短序列实现状态最佳性能。

关键词

引用

@article{arxiv.2602.21550,
  title  = {Extending Sequence Length is Not All You Need: Effective Integration of Multimodal Signals for Gene Expression Prediction},
  author = {Zhao Yang and Yi Duan and Jiwei Zhu and Ying Ba and Chuan Cao and Bing Su},
  journal= {arXiv preprint arXiv:2602.21550},
  year   = {2026}
}

备注

Accepted at ICLR 2026