中文

Kaleido-BERT:时尚领域的视觉-语言预训练

计算机视觉与模式识别 2021-04-16 v3

摘要

我们提出一种新的视觉-语言(VL)预训练模型 Kaleido-BERT,其引入了一种新颖的万花筒策略,用于从Transformer学习时尚跨模态表征。与近期 VL 模型的随机掩码策略不同,我们设计了对齐引导掩码,以共同聚焦于图像-文本语义关系。为此,我们在不同尺度的图像块上执行五项新颖任务,即旋转、拼图、伪装、灰度转彩色和空白转彩色,用于自监督 VL 预训练。Kaleido-BERT 概念简单且易于扩展到现有 BERT 框架,它在四项下游任务上以大幅优势取得了新的 SOTA 结果,包括文本检索(R@1:绝对提升 4.03%)、图像检索(R@1:绝对提升 7.13%)、类别识别(ACC:绝对提升 3.28%)和时尚描述生成(Bleu4:绝对提升 1.2%)。我们在广泛的电商网站上验证了 Kaleido-BERT 的有效性,展示了其在现实应用中的更广潜力。

关键词

引用

@article{arxiv.2103.16110,
  title  = {Kaleido-BERT: Vision-Language Pre-training on Fashion Domain},
  author = {Mingchen Zhuge and Dehong Gao and Deng-Ping Fan and Linbo Jin and Ben Chen and Haoming Zhou and Minghui Qiu and Ling Shao},
  journal= {arXiv preprint arXiv:2103.16110},
  year   = {2021}
}

备注

CVPR2021 Accepted. Code: https://github.com/mczhuge/Kaleido-BERT