中文

对生物体全组织单细胞 RNA 对齐方法进行基准测试与优化

机器学习 2025-03-27 v1

摘要

已提出许多方法用于消除批次效应并对齐单细胞 RNA (scRNA) 数据集。然而,性能通常仅基于多个参数和少数数据集进行评估,这在评估哪种方法在大规模数据对齐中最佳方面存在挑战。本文引入 K-Neighbors Intersection (KNI) 评分,该评分同时惩罚批次效应并衡量跨数据集单细胞类型标签预测的准确性,同时我们精心挑选了小型 (scMARK) 和大型 (scREF) 基准数据集,分别包含 11 和 46 个人类 scRNA 研究,其中我们对作者标签进行了标准化。使用 KNI 评分,我们评估和优化了跨数据集单细胞 RNA 集成的方法。我们引入 Batch Adversarial single-cell Variational Inference (BA-scVI),作为一种新的 scVI 变体,通过对编码器和解码器进行对抗训练来惩罚批次效应,并展示该方法在其他方法中表现更优。在对齐的空间中,我们发现单细胞类型分组的细节程度得到保持,这支持整个生物体单细胞类型图可由单个模型创建而不会丢失信息的观念。

关键词

引用

@article{arxiv.2503.20730,
  title  = {Benchmarking and optimizing organism wide single-cell RNA alignment methods},
  author = {Juan Javier Diaz-Mejia and Elias Williams and Octavian Focsa and Dylan Mendonca and Swechha Singh and Brendan Innes and Sam Cooper},
  journal= {arXiv preprint arXiv:2503.20730},
  year   = {2025}
}

备注

Accepted to ICLR 2025 LMRL workshop (International Conference on Learning Representations, Learning Meaningful Representations of Life Workshop)