中文

OpenFashionCLIP:基于开源时尚数据的视觉-语言对比学习

计算机视觉与模式识别 2023-09-12 v1

摘要

在线购物和电子商务的持续增长要求可扩展且鲁棒的基于机器学习的解决方案以满足客户需求。在自动标注分类和多模态检索的背景下,先前工作要么定义了泛化性较低的有监督学习方法,要么定义了更具复用性的基于 CLIP 的技术,但均在闭源数据上训练。在本工作中,我们提出 OpenFashionCLIP,一种仅采用来自不同领域、具有不同程度特异性的开源时尚数据的视觉-语言对比学习方法。我们的方法在多个任务和基准上得到广泛验证,实验结果凸显了显著的域外泛化能力,以及在准确率和召回率上相对于最先进(SOTA)方法的一致提升。源代码和训练模型公开于:https://github.com/aimagelab/open-fashion-clip。

关键词

引用

@article{arxiv.2309.05551,
  title  = {OpenFashionCLIP: Vision-and-Language Contrastive Learning with Open-Source Fashion Data},
  author = {Giuseppe Cartella and Alberto Baldrati and Davide Morelli and Marcella Cornia and Marco Bertini and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2309.05551},
  year   = {2023}
}

备注

International Conference on Image Analysis and Processing (ICIAP) 2023