自然词汇从自由形式标注中涌现
计算机视觉与模式识别
2019-06-05 v1
摘要
我们提出一种利用无导向且未受训标注者所写自由形式文本来标注对象类别的方法。自由形式标注对标注者而言很自然,他们直觉地提供非常具体且详尽的标签,且无需训练阶段。我们首先使用124名不同标注者在15k图像上收集了729个标签。随后我们通过在其内部发现一个含4020个类别的自然词汇来自动丰富这些自由形式标注的结构。该词汇很好地代表了对象的自然分布,且直接从数据中学习,而非在收集任何标签前所做的经验性猜测。因此,自然词汇从大量自由形式标注中涌现。为此,我们(i)将原始输入字符串映射到物理对象本体中的实体(赋予其明确含义);(ii)利用标注者间共现,以及各别标注者的偏差与特定知识。最后,我们还自动提取了尺寸缩减且具高对象覆盖度同时保持特异性的自然词汇。这些缩减词汇比常用预定义词汇更好地代表了对象的自然分布。此外,它们具有更均匀的类别样本分布。
引用
@article{arxiv.1906.01542,
title = {Natural Vocabulary Emerges from Free-Form Annotations},
author = {Jordi Pont-Tuset and Michael Gygli and Vittorio Ferrari},
journal= {arXiv preprint arXiv:1906.01542},
year = {2019}
}