通过一致改进比率组合评估指标及其在聚类任务中的应用
人工智能
2014-01-21 v1 机器学习
摘要
许多人工智能任务无法用单一的质量标准来评估,需要某种加权组合来提供系统排名。加权组合度量存在一个问题,即相对权重的微小变化可能会导致系统排名发生实质性改变。本文引入了一致改进比率(Unanimous Improvement Ratio, UIR),这是一种补充标准度量组合准则(如van Rijsbergen的F-measure)的度量指标,用于指示所测得的差异对各个度量相对权重变化的稳健性。UIR旨在阐明两个系统之间观察到的差异是否是个体度量加权方式的人为假象。除了讨论UIR的理论基础外,本文还展示了验证该度量在文本聚类问题中有效性和实用性的实证结果。在文本聚类问题中,基于精确率和召回率的度量之间存在权衡,且结果对用于组合它们的加权方案尤为敏感。值得注意的是,我们的实验表明,UIR可用作预测在给定测试平台上测得的系统差异在不同测试平台上是否依然成立的预测指标。
引用
@article{arxiv.1401.4590,
title = {Combining Evaluation Metrics via the Unanimous Improvement Ratio and its Application to Clustering Tasks},
author = {Enrique Amigó and Julio Gonzalo and Javier Artiles and Felisa Verdejo},
journal= {arXiv preprint arXiv:1401.4590},
year = {2014}
}