中文

学习对齐生成式外观先验以用于细粒度图像检索

计算机视觉与模式识别 2026-05-12 v1

摘要

细粒度图像检索(FGIR)通常依赖来自已见类别的监督来学习判别性嵌入,以检索未见类别。然而,此类监督往往使检索模型偏向于已见类别的语义,而非跨类别泛化的潜在外观特征,从而限制了在未见类别上的检索性能。为了解决这一问题,我们提出了 GAPan,一种生成式外观先验对齐网络,它将学习目标从类别预测重新表述为外观建模。在技术上,GAPan 使用基于归一化流的可逆密度模型处理检索特征。在前向方向,流将所有实例特征映射到潜在密度空间,其中每个已见类别由类条件高斯先验建模,并通过精确似然估计进行优化。该公式利用流的可逆性保留了更丰富的外观细节。在逆向方向,从这些学习到的先验的高密度区域中采样的样本被映射回特征空间,以产生反映类内变化的外观感知锚点。这些锚点监督一个先验驱动的对齐目标,将检索嵌入与特定类别的外观分布对齐,从而提高对未见类别的泛化能力。评估表明,我们的 GAPan 在广泛使用的细粒度和粗粒度基准测试上均取得了 SOTA 性能。

关键词

引用

@article{arxiv.2605.09859,
  title  = {Learning to Align Generative Appearance Priors for Fine-grained Image Retrieval},
  author = {Shijie Wang and Yadan Luo and Zijian Wang and Xin Yu and Zi Huang},
  journal= {arXiv preprint arXiv:2605.09859},
  year   = {2026}
}