SAC:面向文本条件图像检索的语义注意力组合
计算机视觉与模式识别
2021-10-22 v2 人工智能
摘要
高效搜索图像的能力对于改善各类产品中的用户体验至关重要。通过多模态输入融入用户反馈以引导视觉搜索,有助于使检索结果贴合特定用户查询。我们聚焦于文本条件图像检索任务,该任务利用支持性文本反馈与参考图像一同检索同时满足两种输入所施加约束的图像。该任务具有挑战性,因为它需要通过融合来自文本反馈的多个跨粒度语义编辑来学习组合图像-文本特征,并将之应用于视觉特征。为此,我们提出一种新颖框架 SAC,分两个主要步骤解决上述问题:“看何处”(语义特征注意力)与“如何改”(语义特征修正)。我们系统地展示了我们的架构如何通过去除其他最先进技术所需的各类模块,简化文本感知图像特征的生成。我们给出了大量定量、定性分析与消融研究,表明我们的架构 SAC 在 FashionIQ、Shoes 和 Birds-to-Words 三个基准数据集上取得了最先进(SOTA)性能,优于现有技术,同时支持不同长度的自然语言反馈。
引用
@article{arxiv.2009.01485,
title = {SAC: Semantic Attention Composition for Text-Conditioned Image Retrieval},
author = {Surgan Jandial and Pinkesh Badjatiya and Pranit Chawla and Ayush Chopra and Mausoom Sarkar and Balaji Krishnamurthy},
journal= {arXiv preprint arXiv:2009.01485},
year = {2021}
}
备注
Surgan Jandial, Pinkesh Badjatiya, Pranit Chawla, and Ayush Chopra contributed equally to this work. Work accepted at WACV 2022