中文

多示例数据集的特征刻画

计算机视觉与模式识别 2018-06-22 v1

摘要

在许多模式识别问题中,单一特征向量不足以描述一个对象。在多示例学习(MIL)中,对象由特征向量(\emph{示例})的集合(\emph{包})表示。这需要对标准监督分类器进行调整,以便在包上训练和评估。如同监督分类,MIL已有若干基准数据集和众多分类器。在对不同MIL分类器进行比较时,理解所使用数据集的差异十分重要。看似不同(基于维数等因素)的数据集可能在分类器中引发非常相似的行为,反之亦然。这对可从比较结果得出何种结论具有影响。我们旨在概述可用基准数据集与一些流行MIL分类器的变异性。我们使用基于不同分类器所得ROC曲线差异的数据集相异度度量,并将该数据集相异度矩阵嵌入低维空间。结果表明,概念上相似的数据集可能表现迥异。因此,我们建议在比较现有与新MIL分类器时考察此类数据集特征。数据集可通过Figshare在\url{https://bit.ly/2K9iTja}获取。

关键词

引用

@article{arxiv.1806.08186,
  title  = {Characterizing multiple instance datasets},
  author = {Veronika Cheplygina and David M. J. Tax},
  journal= {arXiv preprint arXiv:1806.08186},
  year   = {2018}
}

备注

Published at SIMBAD 2015 workshop