annbatch:实现 anndata 上太阳尺度生物数据训练
机器学习
2026-04-06 v2 基因组学
摘要
生物数据集的规模如今常常超过系统内存,使得数据访问而非模型计算成为训练机器学习模型的主要瓶颈。这一瓶颈在生物学领域尤为突出,因为广泛使用的社区数据格式必须支持异构元数据、稀疏和密集实验数据,以及纳入既定计算生态系统的后续分析。本文介绍 annbatch,这是一个原生支持 anndata 的 mini-batch 数据加载器,使可直接在磁盘后端的数据集上进行离核训练。通过单细胞转录组学、显微镜和全基因组测序基准测试,annbatch 在数据加载吞吐量方面提升了最高可达一个数量级,将训练时间从几天缩短至数小时,同时完全兼容 scverse 生态系统。annbatch 为可扩展的生物学人工智能构建了实用的数据加载基础设施,使 increasingly 大且多样化的数据集能够在不放弃标准生物学数据格式的前提下使用。Github: https://github.com/scverse/annbatch
引用
@article{arxiv.2604.01949,
title = {annbatch unlocks terabyte-scale training of biological data in anndata},
author = {Ilan Gold and Felix Fischer and Lucas Arnoldt and F. Alexander Wolf and Fabian J. Theis},
journal= {arXiv preprint arXiv:2604.01949},
year = {2026}
}