中文

FashionViL:面向时尚领域的视觉与语言表征学习

计算机视觉与模式识别 2022-07-19 v1

摘要

大规模视觉与语言(V+L)预训练用于表征学习已被证明能有效提升各类下游 V+L 任务。然而,在时尚领域,现有 V+L 方法存在不足,因为它们忽视了时尚 V+L 数据及下游任务的独特特性。本工作中,我们提出一种新颖的面向时尚领域的 V+L 表征学习框架,称为 FashionViL。它包含两个专门设计的时尚特定预训练任务,用于特别利用时尚 V+L 数据的两个内在属性。首先,与其他领域单个 V+L 数据点仅含一对图像-文本不同,时尚领域可能包含多张图像。因此我们提出多视角对比学习(Multi-View Contrastive Learning)任务,将一张图像的视觉表征与另一张图像+文本的组合多模态表征拉近。其次,时尚文本(如商品描述)常包含丰富的细粒度概念(属性/名词短语)。为此引入伪属性分类(Pseudo-Attributes Classification)任务,以促使同一概念的学习到的单模态(视觉/文本)表征相互邻近。此外,时尚 V+L 任务独特地包含不符合常见单流或双流架构的任务(如文本引导的图像检索)。因此我们提出一种灵活的、通用的 V+L 模型架构,由与模态无关的 Transformer 组成,从而可灵活适配任意下游任务。大量实验表明,我们的 FashionViL 在五个下游任务上取得了新的 SOTA。代码见 https://github.com/BrandonHanx/mmf。

关键词

引用

@article{arxiv.2207.08150,
  title  = {FashionViL: Fashion-Focused Vision-and-Language Representation Learning},
  author = {Xiao Han and Licheng Yu and Xiatian Zhu and Li Zhang and Yi-Zhe Song and Tao Xiang},
  journal= {arXiv preprint arXiv:2207.08150},
  year   = {2022}
}

备注

ECCV 2022