中文

基于异构本地专家的全球多类分类与数据集构建

机器学习 2021-01-07 v3 信息论 math.IT 机器学习

摘要

在数据集构建和众包领域,一个显著挑战是聚合来自异构标注者的标签,其中每个标注者可能在某些任务子集上是专家(而在其他任务上可靠性较低)。为降低雇佣人类标注者或训练自动标注系统的成本,人们希望在保证所得数据集可靠性的同时尽量减少标注者数量。我们将此建模为使用较小分类器的预测来执行 KK 类分类的问题,每个较小分类器在 [K][K] 的某个子集上训练,并在对抗和随机两种假设下推导了准确推断未标注样本真实类别所需分类器数量的界限。通过利用与经典集合覆盖问题的联系,我们提出了一种近乎最优的此类分类器配置设计方案,该方案将著名的“一对多”分类方法作为特例恢复。在 MNIST 和 CIFAR-10 数据集上的实验表明,我们的聚合方案应用于在数据子集上训练的分类器时具有良好准确率(与集中式分类器相比)。这些结果提出了一种自动标注数据或将现有本地分类器集合适配到更大规模多类问题的新途径。

关键词

引用

@article{arxiv.2005.10848,
  title  = {Global Multiclass Classification and Dataset Construction via Heterogeneous Local Experts},
  author = {Surin Ahn and Ayfer Ozgur and Mert Pilanci},
  journal= {arXiv preprint arXiv:2005.10848},
  year   = {2021}
}

备注

27 pages, 8 figures, to be published in IEEE Journal on Selected Areas in Information Theory (JSAIT) - Special Issue on Estimation and Inference