通过语音实现快速目标类别标注
计算机视觉与模式识别
2019-04-12 v2 人机交互
摘要
目标类别标注是一项用给定类别词表中有无某类物体的标签来标注图像的任务。然而,简单地对每个类别问一个是/否问题,其代价与词表大小成线性关系,因而对于大词表效率低下。现代方法依赖词表的层次化组织来减少标注时间,但仍代价高昂(在 ILSVRC 的 200 个类别上每张图像需数分钟)。相反,我们提出了一种通过语音标注类别的新界面。说话速度快,并可直接说出类别名称,而无需在列表或层次结构中查找。作为额外优势,标注者可同时说话并扫描图像寻找物体,界面可保持极简,且使用时鼠标移动更少。由于使用我们界面的标注者只应说出给定类别词表中的词,我们提出了一项专门任务来训练他们这样做。通过在 COCO 和 ILSVRC 上的实验,我们表明我们的方法以比现有方法少 2.3 倍至 14.9 倍的标注时间给出了高质量标注。
引用
@article{arxiv.1811.09461,
title = {Fast Object Class Labelling via Speech},
author = {Michael Gygli and Vittorio Ferrari},
journal= {arXiv preprint arXiv:1811.09461},
year = {2019}
}
备注
to be published at CVPR 2019