STIR:用于图像检索后处理的孪生 Transformer
信息检索
2023-04-28 v2 计算机视觉与模式识别
摘要
当前图像检索的度量学习方法通常基于学习一个信息丰富的潜表示空间,其中余弦距离等简单方法即可良好工作。近期如 HypViT 等最先进方法转向更复杂的嵌入空间,可能取得更好结果,但难以扩展到生产环境。本工作中,我们首先构建了一个基于三元组损失与难负样本挖掘的更简模型,其性能达到最先进水平且无上述缺陷。其次,我们提出一种称为孪生 Transformer 图像检索(STIR)的图像检索后处理新方法,可在单次前向传播中对若干顶部输出重排序。与先前提出的重排序 Transformer 不同,STIR 不依赖全局/局部特征提取,而是借助注意力机制在像素层面直接比较查询图像与检索候选。该方法在标准图像检索数据集 Stanford Online Products 与 DeepFashion In-shop 上确立了新的最先进水平。我们亦在 https://github.com/OML-Team/open-metric-learning/tree/main/pipelines/postprocessing/ 发布源代码,并在 https://dapladoc-oml-postprocessing-demo-srcappmain-pfh2g0.streamlit.app/ 提供交互式演示。
引用
@article{arxiv.2304.13393,
title = {STIR: Siamese Transformer for Image Retrieval Postprocessing},
author = {Aleksei Shabanov and Aleksei Tarasov and Sergey Nikolenko},
journal= {arXiv preprint arXiv:2304.13393},
year = {2023}
}
备注
14 pages, 3 figures