中文

Designovel 用于 Fashion-IQ 2019 挑战赛的系统描述

计算机视觉与模式识别 2019-10-25 v1 计算与语言 机器学习

摘要

本文描述了 Designovel 提交至 Fashion IQ Challenge 2019 的系统。该挑战赛的目标是构建一个图像检索系统,其中输入查询为一张候选图像加上两个文本短语,描述用户关于候选图像与搜索目标之间视觉差异的反馈。我们通过结合深度度量学习、多模态检索与自然语言处理领域近期工作的方法来构建系统。首先,我们使用 CNN 将候选图像与目标图像编码为高级表示,并使用基于 Transformer 的编码器将文本描述编码为单一文本向量。随后我们将候选图像向量与文本表示组合为单一向量,该向量预期偏向目标图像向量。最后,我们计算组合向量与整个数据集编码向量间的余弦相似度,并按降序排序得到排序列表。我们在 Fashion IQ 2019 数据集上以多种超参数设置进行实验,单个模型在测试集上取得 39.12% 的平均召回率,16 个模型的集成取得 43.67% 的平均召回率。

关键词

引用

@article{arxiv.1910.11119,
  title  = {Designovel's system description for Fashion-IQ challenge 2019},
  author = {Jianri Li and Jae-whan Lee and Woo-sang Song and Ki-young Shin and Byung-hyun Go},
  journal= {arXiv preprint arXiv:1910.11119},
  year   = {2019}
}