中文

GLAMI-1M:一个多语言图像-文本时尚数据集

计算机视觉与模式识别 2022-11-29 v1 计算与语言 机器学习

摘要

我们介绍了 GLAMI-1M:最大的多语言图像-文本分类数据集与基准。该数据集包含时尚产品图像及其物品描述,描述使用 13 种语言之一。划分为 191 个类别的标注具有高质量:测试集中全部 10 万张图像以及 100 万训练集中的 75% 均由人工标注。本文给出了图像-文本分类的基线,表明该数据集呈现一个具有挑战性的细粒度分类问题:使用视觉与文本特征的最佳得分 EmbraceNet 模型达到了 69.7% 的准确率。基于改进 Imagen 模型的实验表明,该数据集也适用于以文本为条件的图像生成。数据集、源代码与模型检查点发布于 https://github.com/glami/glami-1m

关键词

引用

@article{arxiv.2211.14451,
  title  = {GLAMI-1M: A Multilingual Image-Text Fashion Dataset},
  author = {Vaclav Kosar and Antonín Hoskovec and Milan Šulc and Radek Bartyzal},
  journal= {arXiv preprint arXiv:2211.14451},
  year   = {2022}
}