中文

学习疾病与受试者特征:一种用于检测机器学习诊断应用中身份混杂的置换检验方法

应用统计 2018-07-10 v2

摘要

最近,Saeb等人(2017)表明,在诊断机器学习应用中,若每个受试者的数据被随机分配到训练集和测试集(记录级数据划分),由于分类器能够识别受试者而非识别疾病所导致的“受试者身份混杂”的存在,会严重低估交叉验证预测误差。为解决该问题,作者建议将每个受试者的数据随机全部分配至训练集或测试集(受试者级数据划分)。受试者级划分的采用在Little等人(2017)中受到批评,理由是它可能违反交叉验证一致估计泛化误差所需的假设。特别是在异质数据集中采用受试者级划分可能导致模型欠拟合和更大的分类误差。因此,Little等人认为,或许受试者级交叉验证对预测误差的高估,而非记录级交叉验证的低估,才是两种划分策略产生预测误差估计差异的原因。为厘清这一争议,我们聚焦于更简单的分类性能指标,并开发了可检测身份混杂的置换检验。通过关注置换检验,我们能够在更一般的统计依赖关系和数据分布结构下(包括交叉验证失效的情形)评估记录级与受试者级数据划分的优劣。我们使用来自帕金森病研究的合成与真实数据说明了所提检验的应用。

关键词

引用

@article{arxiv.1712.03120,
  title  = {Learning Disease vs Participant Signatures: a permutation test approach to detect identity confounding in machine learning diagnostic applications},
  author = {Elias Chaibub Neto and Abhishek Pratap and Thanneer M Perumal and Meghasyam Tummalacherla and Brian M Bot and Andrew D Trister and Stephen H Friend and Lara Mangravite and Larsson Omberg},
  journal= {arXiv preprint arXiv:1712.03120},
  year   = {2018}
}