基于一个名副其实的玩具数据集的层次图像分类
计算机视觉与模式识别
2021-11-02 v1
摘要
图像分类中的无监督域适应(UDA)仍是一大挑战。在现有 UDA 图像数据集中,类别通常以扁平方式组织,可训练一个简单分类器。然而在某些场景中,扁平类别源自某些基类别。例如,小车属于鸟类。我们定义了这样一种分类任务:类别具有上述特征,且扁平类别与基类别按层次组织,称为层次图像分类。直观上,利用这种层次结构有益于层次图像分类,例如,两个易混淆的类别可能完全属于不同的基类别。本文通过融合从标签层次中学习到的特征来提升分类性能。具体而言,我们训练由层次标签监督并采用 UDA 技术的特征提取器,其对输入图像输出多个特征。随后将这些特征拼接以预测最细粒度类别。本研究使用一个名为 Lego-15 的新数据集进行。Lego-15 数据集由乐高积木的合成图像和真实图像组成,包含 15 个积木类别。每个类别源自一个粗粒度标签和一个中粒度标签。例如,“85080”类关联于积木(粗)和圆积木(中)。在该数据集上,我们证明了我们的方法在层次图像分类的 UDA 中相较基线带来了一致提升。大量消融与变体研究为这一新数据集及所探究的算法提供了见解。
引用
@article{arxiv.2111.00892,
title = {Hierarchical Image Classification with A Literally Toy Dataset},
author = {Long He and Dandan Song and Liang Zheng},
journal= {arXiv preprint arXiv:2111.00892},
year = {2021}
}