双聚类随机矩阵划分及其在法医体液分类中的应用
统计方法学
2023-10-17 v2 应用统计
摘要
无标签数据的分类通常通过有标签样本的监督学习实现。尽管存在许多精密的监督机器学习方法可高精度预测缺失标签,但在需提供可解释结果及有意义置信度度量的情形下,它们常缺乏所需透明度。法医案件数据的体液分类即典型例子。我们提出一种新的带随机矩阵的类分配双聚类狄利克雷过程(BDP-CaRMa),具有三层聚类层次,以及一种基于模型、适应数据矩阵中块结构的分类方法。由于部分观测的类标签缺失,每类数据矩阵的行数未知。BDP-CaRMa 处理此问题,并通过同时双聚类多个各含随机可变行数的矩阵,扩展了现有双聚类方法。我们将方法应用于动机问题——基于犯罪现场 mRNA 谱的体液分类——予以演示。类案数据的分析表明,我们的方法具有可解释性并产生校准良好的后验概率。该模型可更普遍地应用于其他具有与法医数据相似结构的数据类型。
引用
@article{arxiv.2306.15622,
title = {Biclustering random matrix partitions with an application to classification of forensic body fluids},
author = {Chieh-Hsi Wu and Amy D. Roeder and Geoff K. Nicholls},
journal= {arXiv preprint arXiv:2306.15622},
year = {2023}
}
备注
23 pages and 4 figures (paper); 22 pages and 6 figures (supplement); revision adds model comparisons