中文

用于自闭症筛查的无监督聚类方法:基于高斯混合模型实现 95.31% 的准确率

计算机与社会 2025-03-11 v1 机器学习

摘要

尽管全球在公共卫生、临床筛查和科学研究方面做出了努力,自闭症谱系障碍(ASD)仍然是一种难以有效且及时诊断的疾病。传统诊断方法主要依赖监督学习方法,以标记数据的可用性为前提,而获取这些数据既耗时又耗费资源。相比之下,无监督学习提供了一种从无标签数据集中获取洞见的方式,可以加速或辅助诊断过程。本文探讨了四种不同的无监督聚类算法——K-Means、高斯混合模型(GMM)、凝聚聚类和 DBSCAN——以分析一个包含 704 名接受 ASD 筛查的成年人的公开数据集。通过交叉验证进行广泛的超参数调优后,该研究记录了高斯混合模型在映射到原始 ASD/NO 分类时如何实现最高的聚类到标签准确率(95.31%)(4)。其他关键性能指标包括调整兰德指数(ARI)和轮廓分数,进一步说明了每个聚类的内部一致性。该数据集经历了预处理程序,包括数据清洗、分类特征的标签编码和标准化缩放,随后采用彻底的交叉验证方法来评估和比较这四种聚类方法(5)。这些结果突出了无监督方法在辅助 ASD 筛查方面的巨大潜力,特别是在标记数据可能稀疏、不确定或获取成本过高的情况下。随着方法学的不断改进,无监督方法有望增强早期检测举措,并引导资源分配给高风险个体。

关键词

引用

@article{arxiv.2503.05746,
  title  = {Unsupervised Clustering Approaches for Autism Screening: Achieving 95.31% Accuracy with a Gaussian Mixture Model},
  author = {Nora Fink},
  journal= {arXiv preprint arXiv:2503.05746},
  year   = {2025}
}