中文

基于多粒度不确定性正则化的文本反馈组合图像检索

计算机视觉与模式识别 2024-01-31 v6

摘要

我们研究带有文本反馈的组合图像检索。用户通过从粗粒度到细粒度的反馈逐步寻找感兴趣的目标。然而,现有方法仅关注后者,即细粒度检索,在训练时利用正负样本对。这种基于样本对的范式仅考虑一对特定点之间的一对一距离,与一对多的粗粒度检索过程不一致,并损害了召回率。为填补这一空白,我们引入一种统一学习方法,通过考虑多粒度不确定性同时建模粗粒度和细粒度检索。所提方法的核心思想是将细粒度和粗粒度检索分别整合为与小波动和大波动的数据点匹配。具体而言,我们的方法包含两个模块:不确定性建模与不确定性正则化。(1)不确定性建模通过在特征空间中引入同分布波动来模拟多粒度查询。(2)基于不确定性建模,我们进一步引入不确定性正则化,根据波动范围调整匹配目标。与现有方法相比,所提策略显式地阻止模型在早期阶段推远潜在候选,从而提高了召回率。在FashionIQ、Fashion200k和Shoes三个公开数据集上,所提方法相较强基线分别取得了+4.03%、+3.38%和+2.40%的Recall@50精度提升。

关键词

引用

@article{arxiv.2211.07394,
  title  = {Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization},
  author = {Yiyang Chen and Zhedong Zheng and Wei Ji and Leigang Qu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2211.07394},
  year   = {2024}
}