面向多任务图像检索的粒度感知自适应方法
计算机视觉与模式识别
2022-10-06 v1
摘要
若有某个特定领域(即标签集合)的带标签图像,便可为其学习强大的图像搜索模型。然而,一个实用的视觉搜索模型应足够通用,能同时解决多个检索任务,即便这些任务涵盖差异很大的专门领域。此外,它还应能利用来自这些不同检索任务的未标签图像。这正是本文所考虑的更实际场景。我们提出 Grappa 方法应对该问题:从强大的预训练模型出发,仅利用各任务领域的未标签图像,将其自适应以并发处理多个检索任务。我们用多组独立训练的适配器扩展预训练模型,这些适配器使用不同大小的伪标签集合,有效模拟了不同的伪粒度。通过学习融合层并将伪粒度注意力在特征空间邻域间传播加以引导,我们将所有适配器集合调和为一个适用于全部检索任务的统一模型。在由六项异构检索任务构成的基准上的结果表明,无监督 Grappa 模型提升了 SOTA 自监督学习模型的零样本性能,且在部分任务上达到或超越了按任务选择最合适伪粒度的标签感知预言机。
引用
@article{arxiv.2210.02254,
title = {Granularity-aware Adaptation for Image Retrieval over Multiple Tasks},
author = {Jon Almazán and Byungsoo Ko and Geonmo Gu and Diane Larlus and Yannis Kalantidis},
journal= {arXiv preprint arXiv:2210.02254},
year = {2022}
}
备注
ECCV 2022