中文

VisRet:可视化改善知识密集型文本到图像检索

计算机视觉与模式识别 2026-04-28 v5 计算与语言

摘要

文本到图像检索(T2I 检索)仍然具有挑战性,因为跨模态嵌入通常表现为概念包,未能充分表示诸如姿态和视角等结构化视觉关系。我们提出了先可视化后检索(VisRet),这是一种缓解跨模态相似性对齐这一局限的检索范式。VisRet 首先通过 T2I 生成将文本查询投影到图像模态,然后在图像模态内执行检索,以绕过跨模态检索器在识别细微视觉空间特征方面的弱点。在四个基准测试(Visual-RAG、INQUIRE-Rerank、Microsoft COCO 以及我们新提出的包含多实体比较的 Visual-RAG-ME)上,VisRet 大幅优于跨模态相似性匹配以及将 T2I 检索重新转化为文本到文本相似性匹配的基线方法,在使用 CLIP 作为检索器时平均提升了 0.125 的 nDCG@30,在使用 E5-V 时提升了 0.121。对于下游问答任务,VisRet 在 Visual-RAG 和 Visual-RAG-ME 上的 top-1 检索准确率分别提升了 3.8% 和 15.7%,在 top-10 检索上分别提升了 3.9% 和 11.1%。消融研究表明其与不同的 T2I 指令 LLM、T2I 生成模型和下游 LLM 兼容。VisRet 为推进文本-图像检索提供了一个简单而有效的视角。我们的代码和新基准已公开于 https://github.com/xiaowu0162/Visualize-then-Retrieve。

关键词

引用

@article{arxiv.2505.20291,
  title  = {VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval},
  author = {Di Wu and Yixin Wan and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2505.20291},
  year   = {2026}
}

备注

ACL 2026 Camera Ready