调整后的相似度度量与期望违反
统计方法学
2026-01-16 v1 机器学习
统计理论
统计理论
摘要
调整后的相似度度量,如用于跨评估可靠性的 Cohen's kappa 以及用于比较聚类算法的调整 Rand 指数,是比较离散标签的重要工具。这些度量旨在具备在零分布下的期望为 0、在最大相似性下期望为 1 的特性,以便于解释。常常会针对历史和分析原因对度量进行置换分布的调整。当前存在 renewed interest in考虑更适用于情境的其他零模型,如允许随机识别聚类数的聚类集束。本工作的目的是两项—— (1) 对调整算子进行一般化研究,适用于一般零模型以及包括统计标准化为特例的更一般的程序; (2) 识别调整算子产生预期属性的充分条件,其中充分条件与观察数据如何被纳入零分布有关。我们演示了充分条件的违反可能导致重大失效,例如产生非正的度量而非均值为 0 的度量,或产生在统计标准化下确定性为 0 的度量。
引用
@article{arxiv.2601.10641,
title = {Adjusted Similarity Measures and a Violation of Expectations},
author = {William L. Lippitt and Edward J. Bedrick and Nichole E. Carlson},
journal= {arXiv preprint arXiv:2601.10641},
year = {2026}
}
备注
12 pages, 1 figure