协同组:基于噪声标注共识学习的组合图像检索
计算机视觉与模式识别
2024-09-04 v2
摘要
组合图像检索通过允许用户使用参考图像和描述其意图的文本描述进行搜索,扩展了基于内容的图像检索系统。尽管在开发图像-文本组合器以提取判别性视觉-语言特征方面取得了巨大进展,我们发现了一种迄今被忽视的问题——三元组歧义,它阻碍了鲁棒的特征提取。三元组歧义指的是在参考图像、相对文本描述和目标图像之间产生的一种语义歧义。这主要是由于标注文本的有限表示,导致许多噪声三元组,其中多个视觉上不相似的候选图像可以匹配到相同的参考对(即参考图像+相对文本描述)。为应对这一挑战,我们提出了共识网络(Css-Net),其灵感来源于群体优于个体的心理学概念。Css-Net包含两个核心组件:(1)一个由四个不同组合器组成的共识模块,每个组合器生成不同的图像-文本嵌入,促进互补特征提取并减少对任一可能带有偏见的单一组合器的依赖;(2)一种Kullback-Leibler散度损失,鼓励学习组合器间的交互以促进共识输出。在评估期间,四个组合器的决策通过加权方案进行组合,增强整体一致性。在基准数据集上,特别是FashionIQ,Css-Net展现出显著改进。值得注意的是,它实现了显著的召回率提升,R@10提高2.77%,R@50提升6.67%,突显了其在解决现有方法根本性局限方面的竞争力。
引用
@article{arxiv.2306.02092,
title = {Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations},
author = {Xu Zhang and Zhedong Zheng and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2306.02092},
year = {2024}
}
备注
Accepted by Knowledge-Based Systems (KBS)