中文

调整后的相似度度量与期望违反

统计方法学 2026-01-16 v1 机器学习 统计理论 统计理论

摘要

调整后的相似度度量,如用于跨评估可靠性的 Cohen's kappa 以及用于比较聚类算法的调整 Rand 指数,是比较离散标签的重要工具。这些度量旨在具备在零分布下的期望为 0、在最大相似性下期望为 1 的特性,以便于解释。常常会针对历史和分析原因对度量进行置换分布的调整。当前存在 renewed interest in考虑更适用于情境的其他零模型,如允许随机识别聚类数的聚类集束。本工作的目的是两项—— (1) 对调整算子进行一般化研究,适用于一般零模型以及包括统计标准化为特例的更一般的程序; (2) 识别调整算子产生预期属性的充分条件,其中充分条件与观察数据如何被纳入零分布有关。我们演示了充分条件的违反可能导致重大失效,例如产生非正的度量而非均值为 0 的度量,或产生在统计标准化下确定性为 0 的度量。

关键词

引用

@article{arxiv.2601.10641,
  title  = {Adjusted Similarity Measures and a Violation of Expectations},
  author = {William L. Lippitt and Edward J. Bedrick and Nichole E. Carlson},
  journal= {arXiv preprint arXiv:2601.10641},
  year   = {2026}
}

备注

12 pages, 1 figure