虚拟染色在高通量筛选中的泛化能力研究
机器学习
2024-10-01 v3 人工智能
计算机视觉与模式识别
定量方法
摘要
制药行业的高通量筛选 (HTS) 中的大规模和多样化成像数据为训练虚拟染色模型提供了绝佳资源。然而,在不同实验条件下在训练一个条件下训练的模型是否能够泛化到其他条件,仍未得到充分探索。本研究系统性地检验了来自三种细胞类型(肺部、卵巢和乳腺)和两种表型(毒性和非毒性条件)的 HTS 数据,是否能够有效训练虚拟染色模型以泛化到三种典型的 HTS 分布转移:未见表型、未见细胞类型以及两者的组合。我们利用 772,416 组亮场、细胞、核和 DNA 损伤染色图像数据集,评估模型在像素级、实例级和生物特征级水平上的泛化能力。我们的发现表明,仅在非毒性条件下训练虚拟核和细胞染色模型,不仅能泛化到毒性条件样本,还能在所有评估水平上实现更好的性能。对于未见细胞类型的泛化能力呈现差异,取决于细胞类型;在其他条件下训练的卵巢或肺部细胞样本往往表现良好,而训练乳腺细胞样本的模型则持续表现不佳。对于未见细胞类型和表型的泛化能力,表现优于仅处理未见细胞类型。该研究代表了对虚拟染色模型在多样化 HTS 数据集上泛化能力进行大规模、数据中心分析的首次尝试,为实验训练数据生成提供了有价值的策略。
引用
@article{arxiv.2407.06979,
title = {Can virtual staining for high-throughput screening generalize?},
author = {Samuel Tonks and Cuong Nguyen and Steve Hood and Ryan Musso and Ceridwen Hopely and Steve Titus and Minh Doan and Iain Styles and Alexander Krull},
journal= {arXiv preprint arXiv:2407.06979},
year = {2024}
}