中文

歧义下的分类:平均-K 何时优于 Top-K?

机器学习 2021-12-17 v1 计算机视觉与模式识别 机器学习

摘要

当存在许多可能标签时,仅选一个会导致低精度。一种常见替代方案称为 top-KK 分类,即选取某个数 KK(通常约为 5)并返回得分最高的 KK 个标签。遗憾的是,对于无歧义情形,K>1K>1 过多;而对于高度歧义情形,K5K \leq 5(例如)又可能过少。另一种合理策略是使用自适应方法,返回的标签数随计算出的歧义变化,但在所有样本上必须平均到某个特定的 KK。我们将此替代方案记为平均-KK 分类。本文正式刻画了平均-KK 分类能比固定 top-KK 分类取得更低错误率的歧义分布情形。此外,它为固定规模与自适应分类器提供了自然的估计过程并证明其一致性。最后,它在真实世界图像数据集上的实验揭示了平均-KK 分类相对于 top-KK 在实际中的益处。总体而言,当歧义被精确已知时,平均-KK 绝不劣于 top-KK;且在我们的实验中,当其被估计时,这一结论同样成立。

关键词

引用

@article{arxiv.2112.08851,
  title  = {Classification Under Ambiguity: When Is Average-K Better Than Top-K?},
  author = {Titouan Lorieul and Alexis Joly and Dennis Shasha},
  journal= {arXiv preprint arXiv:2112.08851},
  year   = {2021}
}

备注

53 pages, 21 figures