数据代表性准则:基于数据集相似性预测监督分类性能
计算机视觉与模式识别
2020-08-13 v1 统计方法学
摘要
在广泛领域中,复用监督分类算法并将其应用于新数据集可能是可取的。然而,此类算法的泛化从而达成相似分类性能,仅当用于构建算法的训练数据与欲应用的新未见数据相似时才有可能。通常事先未知算法在新未见数据上的表现,这是不部署算法的关键原因。因此,需要测量数据集相似性的工具。本文中,我们提出数据代表性准则(DRC)以确定训练数据集对新未见数据集的代表性程度。我们给出原理验证,以观察DRC能否量化数据集相似性以及DRC是否与监督分类算法性能相关。我们比较了若干磁共振成像(MRI)数据集,其采集参数差异从细微到严重不等。结果表明,基于数据集相似性,DRC能够指示监督分类器性能何时下降。DRC的严格度可由用户设定,取决于其认为可接受的欠性能程度。
引用
@article{arxiv.2002.12105,
title = {The Data Representativeness Criterion: Predicting the Performance of Supervised Classification Based on Data Set Similarity},
author = {Evelien Schat and Rens van de Schoot and Wouter M. Kouw and Duco Veen and Adriënne M. Mendrik},
journal= {arXiv preprint arXiv:2002.12105},
year = {2020}
}
备注
12 pages, 6 figures