中文

FashionBERT:用于跨模态检索的自适应损失文本与图像匹配

信息检索 2020-06-01 v2 计算机视觉与模式识别 机器学习 图像与视频处理

摘要

在本文中,我们解决时尚行业跨模态检索中的文本与图像匹配问题。与通用领域的匹配不同,时尚匹配需要更多地关注时尚图像和文本中的细粒度信息。先驱方法从图像中检测感兴趣区域(即 RoIs),并使用 RoI 嵌入作为图像表示。通常,RoI 倾向于表示时尚图像中的“对象级”信息,而时尚文本倾向于描述更详细的信息,例如风格、属性。因此,RoI 对于时尚文本和图像匹配而言不够细粒度。为此,我们提出 FashionBERT,它利用图像块作为图像特征。以预训练的 BERT 模型为骨干网络,FashionBERT 学习文本和图像的高级表示。同时,我们提出一种自适应损失来权衡 FashionBERT 建模中的多任务学习。两个任务(即文本与图像匹配和跨模态检索)被用于评估 FashionBERT。在公开数据集上,实验表明 FashionBERT 的性能比基线和最先进的方法有显著提升。在实践中,FashionBERT 被应用于一个具体的跨模态检索应用。我们提供了详细的匹配性能和推理效率分析。

关键词

引用

@article{arxiv.2005.09801,
  title  = {FashionBERT: Text and Image Matching with Adaptive Loss for Cross-modal Retrieval},
  author = {Dehong Gao and Linbo Jin and Ben Chen and Minghui Qiu and Peng Li and Yi Wei and Yi Hu and Hao Wang},
  journal= {arXiv preprint arXiv:2005.09801},
  year   = {2020}
}

备注

10 pages, to be published in SIGIR20 Industry Track