中文

Fashion-IQ 2020 挑战赛亚军团队方案

计算机视觉与模式识别 2020-07-14 v1

摘要

本文致力于 VAA 团队提交至 CVPR 2020 Fashion-IQ 挑战赛的方法。给定一对图像与文本,我们提出一种新颖的多模态组合方法 RTIC,能有效将文本与图像模态组合进语义空间。我们提取分别由 CNNs 和序列模型(如 LSTM 或 GRU)编码的图像与文本特征。为强调目标与候选间特征残差的意义,RTIC 由带通道注意力模块的 N 个块组成。然后,我们将编码后的残差加至候选图像特征上以获得合成特征。我们还探索了带模型变体的集成策略,相较最佳单模型取得显著性能提升。最终,我们的方法以排行榜测试分数 48.02 在 Fashion-IQ 2020 挑战赛中获得亚军。

关键词

引用

@article{arxiv.2007.06404,
  title  = {Fashion-IQ 2020 Challenge 2nd Place Team's Solution},
  author = {Minchul Shin and Yoonjae Cho and Seongwuk Hong},
  journal= {arXiv preprint arXiv:2007.06404},
  year   = {2020}
}

备注

4 pages, CVPR 2020 Workshop, Fashion IQ Challenge