中文

基于双部图注意力的大规模 scRNA-seq 数据聚类

机器学习 2026-02-10 v1 基因组学

摘要

scRNA-seq 聚类是分析单细胞 RNA 测序(scRNA-seq)数据的关键任务,因为它将表达相似的细胞分组。变压器作为强大的基础模型,已被应用于 scRNA-seq 聚类。其自注意力机制自动为同一簇内的细胞分配更高的注意力权重,从而增强簇之间的区分。现有方法如基于图的变压器模型,将每个细胞视为序列中的一个 token。其计算和空间复杂度为 O(n2)\mathcal{O}(n^2) 随细胞数量而增长,限制了其在大规模 scRNA-seq 数据集上的应用。为此,我们提出了一种基于双部图注意力的聚类模型(BGFormer),用于 scRNA-seq 数据。我们引入一组可学习的锚 token 作为表示整个数据集的共享参考点。引入双部图注意力机制来学习细胞与锚 token 之间的相似性,将同一类别的细胞在嵌入空间中彼此靠近。BGFormer 对于细胞数量具有线性计算复杂度,使其可扩展到大数据集。在多个大规模 scRNA-seq 数据集上的实验结果表明,BGFormer 在有效性和可扩展性方面均表现出色。

关键词

引用

@article{arxiv.2602.07475,
  title  = {Bipartite Graph Attention-based Clustering for Large-scale scRNA-seq Data},
  author = {Zhuomin Liang and Liang Bai and Xian Yang},
  journal= {arXiv preprint arXiv:2602.07475},
  year   = {2026}
}