HABIT:用于构成图像检索的Chrono-Synergia 鲁棒渐进学习框架
摘要
构成图像检索 (CIR) 是一种灵活的图像检索范式,使用户能够通过由 reference 图像和 modification text 组成的多模态查询准确定位目标图像。尽管该任务在 personalized search 和 recommendation 系统中显示出有前景的应用,但在实际场景中遇到严重挑战,称为 Noise Triplet Correspondence (NTC) 问题。这一问题主要源于对 triplet 数据高成本和主观性标注所致。为解决这一问题,我们识别出两个核心挑战:构成语义差异的精确估计和对 modification discrepancy 的不足渐进适应性。为此,我们提出 cHrono-synergiA roBust progressIve learning framework for composed image reTrieval (HABIT),其包含两个核心模块。首先,Mutual Knowledge Estimation 模块通过计算 composed feature 与 target 图像之间的相互信息 Transition Rate 来量化样本的干净程度,从而有效识别与 intended modification 语义一致的干净样本。其次,Dual-consistency Progressive Learning 模块在 historical 和 current 模型之间引入协作机制,模拟 human habit formation 以保留 good habits 并校准 bad habits,从而在 NTC 的存在下实现稳健学习。在两个标准 CIR 数据集上进行的大量实验表明,HABIT 在各种噪声比例下均显著优于大多数方法,展现出卓越的鲁棒性和检索性能。代码已公开于 https://github.com/Lee-zixu/HABIT。
引用
@article{arxiv.2604.18037,
title = {HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval},
author = {Zixu Li and Yupeng Hu and Zhiwei Chen and Shiqi Zhang and Qinlei Huang and Zhiheng Fu and Yinwei Wei},
journal= {arXiv preprint arXiv:2604.18037},
year = {2026}
}
备注
Accepted by AAAI 2026