谁标注了什么:对个体标注者的建模改进分类
机器学习
2018-01-08 v2 计算机视觉与模式识别
摘要
数据通常由许多不同的专家标注,每位专家只标注一小部分数据,且每个数据点由多位专家标注。这减轻了单个专家的工作负担,也更好地估计了未观测的真实标签。当专家意见不一致时,标准方法是把多数意见当作正确标签,或将正确标签建模为一个分布。然而,这些方法没有利用关于哪位专家产生了哪个标签的潜在有价值信息。为了利用这一额外信息,我们提出对专家个体进行建模,然后学习用于组合它们的平均权重,可能是样本特定的方式。这使我们能够给予更可靠的专家更多权重,并发挥个体专家在分类某些类型数据时的独特优势。在此我们展示我们的方法在糖尿病视网膜病变的计算机辅助诊断中带来了改进。我们还表明我们的方法优于 Welinder 和 Perona (2010) 以及 Mnih 和 Hinton (2012) 的竞争性算法。我们的工作为处理众多利用专家意见定义训练标签的现实世界场景提供了一种创新方法。
引用
@article{arxiv.1703.08774,
title = {Who Said What: Modeling Individual Labelers Improves Classification},
author = {Melody Y. Guan and Varun Gulshan and Andrew M. Dai and Geoffrey E. Hinton},
journal= {arXiv preprint arXiv:1703.08774},
year = {2018}
}
备注
AAAI 2018