中文

OmniCellTOSG:首个用于图语言基础建模的细胞文本-组学信号图谱数据集

人工智能 2026-02-05 v2 机器学习

摘要

随着大规模单细胞组学数据集的快速增长,组学基础模型已成为推进生命科学和精准医学研究的强大工具。然而,大多数现有的组学基础模型主要通过将基因排序为序列来依赖数值转录组数据,缺乏对科学发现至关重要的生物医学先验知识和信号相互作用的显式整合。在此,我们引入了文本-组学信号图谱(TOSG),一种统一人类可解释的生物医学文本知识、定量组学数据和信号网络信息的新型数据结构。使用这一框架,我们构建了 OmniCellTOSG,一个包含约 50 万个元细胞 TOSG 的大规模资源,这些 TOSG 源自跨器官和疾病的约 8000 万个单细胞和单核 RNA-seq 谱。我们进一步开发了 CellTOSG-FM,一个多模态图语言基础模型,以联合分析文本、组学和信号网络上下文。在多种下游任务中,CellTOSG-FM 优于现有的组学基础模型,并为疾病相关靶点和信号通路提供了可解释的见解。

关键词

引用

@article{arxiv.2504.02148,
  title  = {OmniCellTOSG: The First Cell Text-Omic Signaling Graphs Dataset for Graph Language Foundation Modeling},
  author = {Heming Zhang and Tim Xu and Dekang Cao and Shunning Liang and Guntaas Shergill and Nicholas Hadas and Lars Schimmelpfennig and Levi Kaster and Di Huang and Guangfu Li and S. Peter Goedegebuure and David DeNardo and Li Ding and Ryan C. Fields and J Philip Miller and Pirooz Eghtesady and Carlos Cruchaga and William Buchser and Jonathan Cooper and Marco Sardiello and Patricia Dickson and Yixin Chen and Michael Province and Philip Payne and Fuhai Li},
  journal= {arXiv preprint arXiv:2504.02148},
  year   = {2026}
}