DiviK:用于大数据生物数据中免手动无监督聚类的分裂式智能K-Means
定量方法
2023-01-19 v5
摘要
研究分子异质性可揭示肿瘤起源和代谢组学信息。日益增长的数据量使人工分析不可行——因此,自动化无监督学习方法被用于发现异质性。然而,自动化无监督分析需要大量设置超参数的经验,且通常需预先知道预期子结构的数量。此外,大量被测分子需要额外的特征工程步骤以提供有价值的结果。在这项工作中,我们提出DiviK:一种可扩展的逐步算法,具有局部数据驱动的特征空间自适应,用于高维数据集的分割。结合三个质量指标:Dice指数、Rand指数和EXIMS分数,用于在3D空间中评估无监督分析的质量。DiviK在通过质谱成像在2D和3D获取的两个独立高通量数据集上进行了验证。DiviK可成为质谱成像数据初始探索时考虑的默认选择之一。它在绝对异质性检测与关注生物学合理结构之间提供了权衡,且不需要在分析前指定预期结构的数量。凭借其独特的局部特征空间自适应,它在关注细节时对主导性全局模式具有鲁棒性。最后,由于其简单性,DiviK易于推广到更灵活的框架,适用于其他“-omics”数据或一般的表格数据(包括适当嵌入后的医学图像)。通用实现遵循Apache 2.0许可,可在 https://github.com/gmrukwa/divik 免费获取。
引用
@article{arxiv.2009.10706,
title = {DiviK: Divisive intelligent K-Means for hands-free unsupervised clustering in big biological data},
author = {Grzegorz Mrukwa and Joanna Polanska},
journal= {arXiv preprint arXiv:2009.10706},
year = {2023}
}
备注
24 pages, 11 figures