基于丰富多样文本描述的大规模零样本图像分类
计算机视觉与模式识别
2021-03-18 v1
摘要
我们研究了在ImageNet上使用丰富多样的类别文本描述进行零样本学习(ZSL)的影响。我们创建了一个新数据集ImageNet-Wiki,将每个ImageNet类别与其对应的维基百科文章相匹配。我们表明,仅将这些维基百科文章作为类别描述使用,就能比先前工作取得高得多的ZSL性能。即使一个使用该类型辅助数据的简单模型,也优于依赖类别名称词嵌入编码标准特征的SOTA模型。这些结果凸显了文本描述对ZSL的有用性和重要性,以及辅助数据类型相对于算法进展的相对重要性。我们的实验结果还表明,标准零样本学习方法在类别间泛化能力很差。
引用
@article{arxiv.2103.09669,
title = {Large-Scale Zero-Shot Image Classification from Rich and Diverse Textual Descriptions},
author = {Sebastian Bujwid and Josephine Sullivan},
journal= {arXiv preprint arXiv:2103.09669},
year = {2021}
}
备注
Accepted to LANTERN 2021. Project website: https://bujwid.eu/p/zsl-imagenet-wiki