中文

耦合混淆校正:从稀疏标注的众包中学习

机器学习 2024-02-21 v3 计算机视觉与模式识别 人机交互

摘要

随着数据集规模越来越大,由于时间和经济成本高昂,对此类数据集进行准确标注变得越来越不切实际。因此,众包被广泛采用以减轻收集标签的成本,这也不可避免地引入了标签噪声,并最终降低模型性能。为了从众包标注中学习,对每个标注者的专业水平进行建模是一个常见但具有挑战性的范式,因为众包收集的标注通常高度稀疏。为了缓解这个问题,我们提出了耦合混淆校正 (CCC),其中同时训练两个模型来纠正彼此学习到的混淆矩阵。通过双层优化,一个模型学习到的混淆矩阵可以由另一个模型提取的数据进行纠正。此外,我们对共享相似专业水平的“标注者组”进行聚类,以便可以一起纠正他们的混淆矩阵。这样,可以更好地捕获标注者的专业水平,尤其是那些提供极少标签的标注者。值得注意的是,我们指出标注稀疏性不仅意味着平均标签数量低,而且总有一些标注者提供非常少的标签,这在以前构建合成众包标注的工作中被忽略了。基于此,我们建议使用 Beta 分布来控制众包标签的生成,以便合成标注可以更与现实世界中的标注一致。在两种类型的合成数据集和三个现实世界数据集上进行了大量实验,结果表明 CCC 显著优于 SOTA 方法。源代码可在以下网址获取:https://github.com/Hansong-Zhang/CCC。

关键词

引用

@article{arxiv.2312.07331,
  title  = {Coupled Confusion Correction: Learning from Crowds with Sparse Annotations},
  author = {Hansong Zhang and Shikun Li and Dan Zeng and Chenggang Yan and Shiming Ge},
  journal= {arXiv preprint arXiv:2312.07331},
  year   = {2024}
}

备注

This work has been accepted by AAAI-24