基于世界模型预测缺失目标相关信息以实现准确的零样本构图图像检索
计算机视觉与模式识别
2025-04-01 v2
摘要
零样本构图图像检索 (ZS-CIR) 包含多样化任务,涵盖领域、场景、对象和属性等广泛的视觉内容操控意图。ZS-CIR 的关键挑战在于,当参考图像缺乏必要的目标内容时,如何根据操控文本修改参考图像以准确检索目标图像。本文提出一种新型基于预测的映射网络,命名为 PrediCIR,用于在潜在空间中自适应预测参考图像中缺失的目标视觉内容。具体而言,世界视图生成模块首先通过省略目标视图的某些视觉内容构建源视图,同时包含从现有图像-标题对中派生的包含操控意图的动作。然后,目标内容预测模块训练一个世界模型作为预测器,依据操控文本中的用户意图,在潜在空间中自适应预测缺失的视觉信息。该两个模块将包含预测相关信息的图像映射到不带额外监督的伪单词标记。我们的模型在六个 ZS-CIR 任务上表现出强大的泛化能力。它在最佳方法之上获得了从 1.73% 到 4.45% 的持续显著性能提升,并在 ZS-CIR 上实现了新的最先进成果。我们的代码可在 https://github.com/Pter61/predicir 查阅。
引用
@article{arxiv.2503.17109,
title = {Missing Target-Relevant Information Prediction with World Model for Accurate Zero-Shot Composed Image Retrieval},
author = {Yuanmin Tang and Jing Yu and Keke Gai and Jiamin Zhuang and Gang Xiong and Gaopeng Gou and Qi Wu},
journal= {arXiv preprint arXiv:2503.17109},
year = {2025}
}
备注
This work has been accepted to CVPR 2025