使用重排序Transformer的实例级图像检索
计算机视觉与模式识别
2022-06-07 v3
摘要
实例级图像检索是在大型数据库中搜索与查询图像中某物体相匹配图像的任务。为解决该任务,系统通常依赖使用全局图像描述子的检索步骤,以及后续通过利用基于局部特征的几何验证等操作进行特定领域细化或重排序的步骤。在本工作中,我们提出重排序Transformer(RRTs)作为一种通用模型,以有监督方式融合局部与全局特征来重排序匹配图像,从而替代相对昂贵的几何验证过程。RRTs轻量且易于并行化,使得对一组顶部匹配结果进行重排序可在单次前向传播中完成。我们在Revisited Oxford和Paris数据集以及Google Landmarks v2数据集上进行了大量实验,表明RRTs在使用远少局部描述子的同时优于以往的重排序方法。此外,我们证明与现有方法不同,RRTs可与特征提取器联合优化,从而能得到专为下游任务定制的特征表示并进一步提升精度。代码与训练模型公开于https://github.com/uvavision/RerankingTransformer。
引用
@article{arxiv.2103.12236,
title = {Instance-level Image Retrieval using Reranking Transformers},
author = {Fuwen Tan and Jiangbo Yuan and Vicente Ordonez},
journal= {arXiv preprint arXiv:2103.12236},
year = {2022}
}
备注
ICCV 2021, Table-3 corrected