TEDDY: 用于理解单细胞生物学的基础模型家族
机器学习
2026-04-03 v2 定量方法
摘要
理解疾病的生物学机制对医学,尤其是药物发现至关重要。AI 驱动的基因组规模生物数据分析在这方面具有巨大潜力。单细胞 RNA 测序数据的日益普及推动了疾病生物学大型基础模型的发展。然而,现有基础模型在下游应用中仅比任务特定模型有适度的提升。在此,我们探索了改进单细胞基础模型的两条途径。第一,我们将预训练数据扩展至 11600 万个细胞的多样化集合,规模大于先前模型使用的数据。第二,我们利用大规模生物注释的可用性作为预训练期间的一种监督信号。我们训练了 \\model 模型家族,包含六个基于 Transformer 的最先进单细胞基础模型,参数规模分别为 7000 万、1.6 亿和 4 亿。我们在多个下游评估任务上验证了模型,包括识别训练中未见过的保留供体的潜在疾病状态、区分训练中未见过的疾病和供体的患病细胞与健康细胞,以及探测学到的表示中已知的生物学知识。我们的模型相较于现有工作有了显著提升,扩展实验表明性能随数据量和参数数量可预测地提升。
引用
@article{arxiv.2503.03485,
title = {TEDDY: A Family Of Foundation Models For Understanding Single Cell Biology},
author = {Alexis Chevalier and Soumya Ghosh and Urvi Awasthi and James Watkins and Julia Bieniewska and Nichita Mitrea and Olga Kotova and Kirill Shkura and Andrew Noble and Michael Steinbaugh and Vijay Sadashivaiah and George Dasoulas and Julien Delile and Christoph Meier and Leonid Zhukov and Iya Khalil and Srayanta Mukherjee and Judith Mueller},
journal= {arXiv preprint arXiv:2503.03485},
year = {2026}
}
备注
ICML 2025 Generative AI and Biology (GenBio) Workshop