中文

具有自动权重选择的 Gower 相似系数

统计方法学 2024-01-31 v1 应用统计 机器学习

摘要

最近邻方法在统计学中已变得流行,并在统计学习中扮演着关键角色。最近邻方法中的重要决策涉及使用哪些变量(当存在许多潜在候选变量时)以及如何度量单元之间的相异性。第一个决策取决于应用范围,而第二个决策主要取决于变量的类型。不幸的是,能够处理混合类型变量(实际应用中经常遇到的情况)的选项相对较少。最流行的混合类型变量相异性度量是由 Gower 相似系数之一取补数推导而来的。它之所以具有吸引力,是因为其范围在 0 到 1 之间,是逐变量计算的缩放相异性的平均值,能处理缺失值,并允许在平均相异性时采用用户定义的加权方案。关于加权方案的讨论有时会产生误导,因为它常常忽略了未加权的“标准”设置隐藏了单个变量对总体相异性贡献不均衡的问题。我们遵循近期引入一种加权方案的思想来解决这一缺陷,该方案旨在最小化每个贡献相异性与所得加权 Gower 相异性之间相关性的差异。特别地,本说明根据变量类型提出了不同的相关性度量方法。在与分类和缺失值填补相关的模拟研究中,评估了所提方法的性能。

关键词

引用

@article{arxiv.2401.17041,
  title  = {Gower's similarity coefficients with automatic weight selection},
  author = {Marcello D'Orazio},
  journal= {arXiv preprint arXiv:2401.17041},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2101.02481