ConeSep:面向组合图像检索的基于锥体的鲁棒噪声遗忘组合网络
计算机视觉与模式识别
2026-04-23 v1
摘要
组合图像检索(CIR)任务通过参考图像和修改文本提供了一种灵活的检索范式,但它严重依赖昂贵且易出错的三元组标注。本文系统地研究了由标注引入的噪声三元组对应(NTC)问题。我们发现,NTC 噪声,特别是“硬噪声”(即参考图像和目标图像高度相似但修改文本不正确),对现有的噪声对应学习(NCL)方法构成了独特挑战,因为它打破了传统的“小损失假设”。我们识别并阐明了 NTC 任务中三个关键但被忽视的挑战,即(C1)模态抑制、(C2)负锚点不足和(C3)遗忘反冲。为解决这些挑战,我们提出了一个基于锥体的鲁棒噪声遗忘组合网络(ConeSep)。具体来说,我们首先提出几何保真度量化,从理论上建立并在实践中估计一个噪声边界,以精确定位噪声对应。接着,我们引入负边界学习,为每个查询学习一个“对角负组合”,作为其在嵌入空间中的显式语义对立锚点。最后,我们设计了基于边界的目标遗忘,将噪声校正过程建模为一个最优传输问题,从而巧妙地避免了遗忘反冲。在基准数据集(FashionIQ 和 CIRR)上的大量实验表明,ConeSep 显著优于当前最先进的方法,充分证明了我们方法的有效性和鲁棒性。
引用
@article{arxiv.2604.20358,
title = {ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval},
author = {Zixu Li and Yupeng Hu and Zhiwei Chen and Mingyu Zhang and Zhiheng Fu and Liqiang Nie},
journal= {arXiv preprint arXiv:2604.20358},
year = {2026}
}
备注
Accepted by CVPR 2026