通过将Kullback-Leibler散度与Cohen's Kappa相关联的分类性能极限
机器学习
2024-03-05 v1 机器学习
数据分析、统计与概率
摘要
机器学习分类算法的性能通过使用训练数据和交叉验证估计指标(通常来自混淆矩阵)来评估。然而,这并不能证明已经达到了最佳可能性能。错误率的基本极限可以通过信息距离度量来估计。为此,混淆矩阵被公式化以符合Chernoff-Stein引理。这将错误率与描述两个类别的概率密度函数之间的Kullback-Leibler散度联系起来。这导致了一个关键结果,将Cohen's Kappa与电阻平均距离联系起来,电阻平均距离是两个Kullback-Leibler散度的并联电阻组合。电阻平均距离的单位是比特,并使用分类算法使用的相同训练数据,通过kNN估计Kullback-Leibler散度来估计。分类算法给出混淆矩阵和Kappa。详细讨论了理论和方法,然后应用于蒙特卡洛数据和真实数据集。分析了四个非常不同的真实数据集——乳腺癌、冠心病、破产和粒子识别——包含连续值和离散值,并将其分类性能与预期的理论极限进行比较。在所有情况下,该分析表明,由于两个类别的底层概率密度函数,算法不可能表现得更好。关于如何使用近似平衡的训练数据集预测不平衡数据算法性能的重要经验教训被学到。机器学习非常强大,但分类性能最终取决于数据的质量和变量与问题的相关性。
引用
@article{arxiv.2403.01571,
title = {Limits to classification performance by relating Kullback-Leibler divergence to Cohen's Kappa},
author = {L. Crow and S. J. Watts},
journal= {arXiv preprint arXiv:2403.01571},
year = {2024}
}
备注
Presented at the American Statistical Association Symposium on Data Science and Statistics, St. Louis, USA, May 2023