GOGGLES:基于亲和编码的自动图像标注
计算机视觉与模式识别
2020-03-04 v3 数据库
摘要
生成大规模标注训练数据正成为构建和部署有监督机器学习模型的最大瓶颈。近来,数据编程范式被提出以降低标注训练数据的人力成本。然而,数据编程依赖于设计标注函数,这仍需要显著的领域专业知识。此外,由于难以用图像(像素)的原始特征表达领域知识,为图像数据集编写标注函数极其困难。我们提出亲和编码,一种用于自动化训练数据标注的、与领域无关的新范式。亲和编码的核心前提是:根据某些亲和函数,属于同一类的样本对的亲和分数平均值应高于属于不同类的样本对。我们构建了 GOGGLES 系统,通过设计一组新颖的可复用图像亲和函数来实现用于标注图像数据集的亲和编码,并提出一种利用小型开发集进行类别推断的新颖层次生成模型。我们在来自不同领域的 5 个图像标注任务上将 GOGGLES 与现有数据编程系统进行比较。GOGGLES 无需任何大量人工标注即取得最低 71%、最高 98% 的标注准确率。在端到端性能方面,GOGGLES 优于最先进的数据编程系统 Snuba 达 21%,优于最先进的少样本学习技术达 5%,且仅距全监督上限差 7%。
引用
@article{arxiv.1903.04552,
title = {GOGGLES: Automatic Image Labeling with Affinity Coding},
author = {Nilaksh Das and Sanya Chaba and Renzhi Wu and Sakshi Gandhi and Duen Horng Chau and Xu Chu},
journal= {arXiv preprint arXiv:1903.04552},
year = {2020}
}
备注
Published at 2020 ACM SIGMOD International Conference on Management of Data