中文

基于加性注意力组合学习的文本反馈图像检索

计算机视觉与模式识别 2022-03-09 v1 计算与语言

摘要

带有文本反馈的有效图像检索将影响一系列现实应用,例如电子商务。给定一张源图像和描述该图像所需修改的文本反馈,目标是检索出与源图像相似且满足所给修改的目标图像,通过组合一个多模态(图像-文本)查询来实现。我们提出了一种解决该问题的新方法——加性注意力组合学习(AACL),其使用基于多模态 transformer 的架构并有效建模图像-文本上下文。具体而言,我们提出了一种基于加性注意力的新颖图像-文本组合模块,可无缝插入深度神经网络。我们还引入了一个源自 Shopping100k 数据集的新的具有挑战性的基准。AACL 在三个大规模数据集(FashionIQ、Fashion200k 和 Shopping100k)上进行了评估,每个数据集均有强基线。大量实验表明,AACL 在所有三个数据集上均取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2203.03809,
  title  = {Image Search with Text Feedback by Additive Attention Compositional Learning},
  author = {Yuxin Tian and Shawn Newsam and Kofi Boakye},
  journal= {arXiv preprint arXiv:2203.03809},
  year   = {2022}
}