基于语义引导的空间转录组数据聚类框架:基因的语义化
机器学习
2025-11-17 v1
摘要
空间转录组学实现了带有空间背景的基因表达轮廓,为组织微环境提供了前所未有的洞见。然而,大多数计算模型将基因视为孤立的数值特征,忽略了其符号中编码的丰富生物学语义。这阻碍了对关键生物学特征的深入理解。为克服这一限制,我们提出SemST(Semantic-Guided Spatial Transcriptomics)框架。SemST利用大型语言模型(LLM)使基因能够通过其符号意义“发声”,将每个组织切片内的基因集合转化为生物学信息化嵌入。这些嵌入随后与图神经网络(GNN)捕获的空间邻域关系融合,实现了生物功能与空间结构的协同整合。我们进一步引入细粒度语义调制(FSM)模块,以最佳方式利用这些生物学先验。FSM模块学习每个切片的仿射变换,使语义嵌入能够对空间特征进行元素级校准,从而动态地将高阶生物学知识注入空间语境。广泛的在公开空间转录组数据集上的实验表明,SemST实现了最先进的聚类性能。关键的是,FSM模块具有即插即用式的多样性,始终在集成到其他基线方法后提升性能。
引用
@article{arxiv.2511.11380,
title = {When Genes Speak: A Semantic-Guided Framework for Spatially Resolved Transcriptomics Data Clustering},
author = {Jiangkai Long and Yanran Zhu and Chang Tang and Kun Sun and Yuanyuan Liu and Xuesong Yan},
journal= {arXiv preprint arXiv:2511.11380},
year = {2025}
}
备注
AAAI'2026 poster paper. 12 pages, 8 figures