让每个标签都有价值:通过集成领域知识处理语义不精确性
计算机视觉与模式识别
2020-10-14 v1 机器学习
摘要
从网络抓取或由志愿者(如 Mechanical Turkers 或公民科学家)提供的噪声数据,被视为专业标注数据的替代方案。已有研究专注于减轻标签噪声的影响。通常将其建模为不准确,即正确标签被同一集合中的错误标签替换。我们考虑标签噪声的额外维度:不精确性。例如,一只非繁殖期的雪鹀被标注为鸟。该标签正确,但不如任务要求的精确。标准 softmax 分类器无法从这种弱标签中学习,因为它们将所有类别视为互斥,而非繁殖期雪鹀和鸟并非如此。我们提出 CHILLAX(用于不精确标签学习与标注外推的类层次结构),一种基于层次分类的方法,以充分利用任意精度的标签。在 NABirds 和 ILSVRC2012 的噪声变体上的实验表明,我们的方法比强基线高出多达 16.4 个百分点,比当前最先进技术高出多达 3.9 个百分点。
引用
@article{arxiv.2010.06469,
title = {Making Every Label Count: Handling Semantic Imprecision by Integrating Domain Knowledge},
author = {Clemens-Alexander Brust and Björn Barz and Joachim Denzler},
journal= {arXiv preprint arXiv:2010.06469},
year = {2020}
}
备注
9 pages pre-print. Accepted for publication at ICPR 2020