VQA4CIR:利用视觉问答增强组合图像检索
计算机视觉与模式识别
2023-12-20 v1
摘要
尽管在组合图像检索(CIR)方面取得了进展,但我们从经验上发现,一定比例的失败检索结果与其相对描述不一致。为了解决这个问题,本工作提供了一种视觉问答(VQA)视角来提升 CIR 的性能。由此产生的 VQA4CIR 是一种后处理方法,可以直接插入现有的 CIR 方法中。给定 CIR 方法检索出的前 C 张图像,VQA4CIR 旨在减少与相对描述不一致的失败检索结果的不利影响。为了找到与相对描述不一致的检索图像,我们求助于“QA 生成到 VQA”的自验证流水线。对于 QA 生成,我们建议微调 LLM(例如 LLaMA)以从每个相对描述中生成几对问答。然后我们微调 LVLM(例如 LLaVA)以获得 VQA 模型。通过将检索到的图像和问题输入 VQA 模型,当 VQA 的答案与 QA 对中的答案不一致时,就可以找到与相对描述不一致的图像。因此,可以通过修改不一致检索图像的排名来提升 CIR 性能。实验结果表明,我们提出的方法在 CIRR 和 Fashion-IQ 数据集上优于最先进的 CIR 方法。
引用
@article{arxiv.2312.12273,
title = {VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering},
author = {Chun-Mei Feng and Yang Bai and Tao Luo and Zhen Li and Salman Khan and Wangmeng Zuo and Xinxing Xu and Rick Siow Mong Goh and Yong Liu},
journal= {arXiv preprint arXiv:2312.12273},
year = {2023}
}