中文

数据集特性决定神经影像患者分层的成功:跨聚类算法的基准分析

机器学习 2025-06-12 v2 神经元与认知 定量方法

摘要

背景:将患者数据驱动地分层为生物学 informed 的亚型有望推动精准精神神经学,但基于神经影像的聚类方法往往无法跨队列泛化。虽然算法创新聚焦于模型复杂度,但底层数据集特性的作用尚未得到充分探索。我们假设输入数据中聚类分离度、大小不平衡、噪声以及疾病相关效应的方向和幅度在决定算法内准确性和可重复性方面起着关键作用。方法:我们在从人类连接组计划青年成人数据集派生的合成脑形态学队列上评估了四种广泛使用的分层算法——HYDRA、SuStaIn、SmileGAN 和 SurrealGAN。对 600 个伪患者相对于 508 个对照应用了三种全局变换模式,随后进行了四种数据集内变化(聚类数 k=2-6、重叠度和效应幅度)。算法性能通过恢复已知真实聚类的准确度来量化。结果:在 122 个合成场景中,数据复杂度始终比算法选择更能预测分层成功。聚类分离良好的情况对所有方法都产生了高准确度,而重叠、大小不等或效应微弱的情况使准确度降低高达 50%。SuStaIn 无法扩展到 17 个特征以上,HYDRA 的准确度随数据异质性不可预测地变化。SmileGAN 和 SurrealGAN 保持了稳健的模式检测能力,但未为个体分配离散聚类标签。结论:研究结果展示了输入数据的统计特性对不同算法的影响,强调了在开发新算法时使用真实数据集分布的必要性,并建议更多关注主动塑造和标准化输入分布的数据中心策略。

关键词

引用

@article{arxiv.2503.12066,
  title  = {Dataset Properties Shape the Success of Neuroimaging-Based Patient Stratification: A Benchmarking Analysis Across Clustering Algorithms},
  author = {Yuetong Yu and Ruiyang Ge and Ilker Hacihaliloglu and Alexander Rauscher and Roger Tam and Sophia Frangou},
  journal= {arXiv preprint arXiv:2503.12066},
  year   = {2025}
}