中文

面向时尚领域的掩码视觉-语言Transformer

计算机视觉与模式识别 2023-06-06 v1 计算与语言

摘要

我们提出了一种面向时尚领域特定多模态表示的掩码视觉-语言Transformer(MVLT)。技术上,我们仅利用视觉Transformer架构替代预训练模型中的BERT,使MVLT成为时尚领域首个端到端框架。此外,我们设计了掩码图像重建(MIR)任务,以实现对时尚的细粒度理解。MVLT是一种可扩展且便捷的架构,无需额外的预处理模型(如ResNet)即可接受原始多模态输入,隐式地建模视觉-语言对齐。更重要的是,MVLT可以轻松泛化到各种匹配和生成任务。实验结果显示,在检索(rank@5: 17%)和识别(准确率: 3%)任务上,相较于Fashion-Gen 2018冠军模型Kaleido-BERT均有显著提升。代码已开源:https://github.com/GewelsJI/MVLT。

关键词

引用

@article{arxiv.2210.15110,
  title  = {Masked Vision-Language Transformer in Fashion},
  author = {Ge-Peng Ji and Mingcheng Zhuge and Dehong Gao and Deng-Ping Fan and Christos Sakaridis and Luc Van Gool},
  journal= {arXiv preprint arXiv:2210.15110},
  year   = {2023}
}

备注

Accepted by Machine Intelligence Research (2023)