面向新领域的草图识别器训练研究
计算机视觉与模式识别
2021-04-20 v1 机器学习
摘要
草图识别算法是利用草图识别社区多年来贡献的公开数据集进行设计和评估的。虽然现有数据集包含有限一组通用物体的草图,但每个新领域都不可避免地需要收集新数据以训练特定领域的识别器。这引发了两个根本性问题:第一,数据收集协议能否产生具有生态效度的数据?第二,所收集的数据量是否足以训练出足够准确的分类器?在本文中,我们提请注意这两个问题。我们表明,数据收集协议的生态效度以及适应小数据集的能力,是在真实场景中影响识别器准确性的重要因素。更具体地说,以基于草图的游戏为用例,我们表明深度学习方法以及更传统的方法都会受到数据集偏移的显著影响。此外,我们证明,在数据稀缺且昂贵的真实场景中,为使深度学习者适应小数据集而采取的标准措施,相较于替代方案并不具备优势。尽管迁移学习和广泛的数据增强有助于深度学习者,但其表现仍明显逊于标准设置(例如,带有标准特征表示的 SVM 和 GBM)。我们将从小数据集学习视为深度草图识别领域的一个关键问题,而现有文献中的大部分工作都忽视了这一问题。
引用
@article{arxiv.2104.08850,
title = {On Training Sketch Recognizers for New Domains},
author = {Kemal Tugrul Yesilbek and T. Metin Sezgin},
journal= {arXiv preprint arXiv:2104.08850},
year = {2021}
}
备注
Accepted for The 1st Workshop on Sketch-Oriented Deep Learning (SketchDL) @ CVPR 2021