中文

AttnGen:用于可解释基因组序列分类的注意力引导显著性学习

机器学习 2026-05-15 v1 人工智能

摘要

深度神经网络在基因组序列分类中取得了出色的性能;然而,将其预测与具有生物学意义的序列模式关联起来仍具挑战性。在本工作中,我们提出了 AttnGen,一个将可解释性直接嵌入优化过程的注意力引导训练框架。AttnGen 使用注意力机制计算核苷酸级别的重要性分数,并在训练过程中逐步抑制低贡献位置。这促使模型将其预测集中在紧凑的信息区域集合上,同时减少对噪声序列元素的依赖。我们在标准化基准 demo_human_or_worm(一个针对 200 个核苷酸序列的二分类任务)上评估了 AttnGen。在适度掩码下,AttnGen 达到了 96.73% 的验证准确率,优于准确率为 95.83% 的传统 CNN 基线,同时展现出更快的收敛速度和更好的训练稳定性。为了评估所学的重要性分数是否反映了功能相关的信号,我们通过移除高显著性核苷酸进行了基于扰动的分析。这导致在 3,000 条序列的评估集上准确率从 96.9% 降至接近随机水平,表明该模型依赖于一个相对较小的信息位置子集。我们的分析表明,掩码 10--20% 的位置在预测性能和可解释性之间提供了最有利的权衡。这些结果表明,注意力引导的掩码不仅提高了分类性能,还重塑了模型在序列位置间分配重要性的方式。尽管本研究侧重于短基因组序列,但所提出的方法可能扩展到更复杂的可解释序列建模场景。

关键词

引用

@article{arxiv.2605.14073,
  title  = {AttnGen: Attention-Guided Saliency Learning for Interpretable Genomic Sequence Classification},
  author = {Rayhaneh Shabani Nia and Ali Karkehabadi},
  journal= {arXiv preprint arXiv:2605.14073},
  year   = {2026}
}

备注

Accepted at IEEE CCGE 2026