中文

大规模视觉语言重排序的高效判别性联合编码器

计算机视觉与模式识别 2026-02-24 v2 机器学习

摘要

多模态检索仍依赖于基于嵌入的模型如 CLIP 用于预计算图像嵌入的快速向量搜索。然而,与文本检索相比,联合编码器 reranker 在视觉语言领域几乎缺席。我们发现,诸如 BLIP 等关键联合编码器受限于昂贵的视觉特征提取阶段,难以在大规模场景中实际部署。为突破这一瓶颈,我们引入 EDJE(Efficient Discriminative Joint Encoder),该模型在离线预计算视觉标记后通过轻量级注意力适配器进行压缩,使得在线推理仅需对小型视觉标记集合和文本进行紧凑的联合编码。EDJE 保持强大的检索性能,同时大幅降低存储需求和在线计算量,实现高吞吐量推理。具体而言,EDJE 能处理每秒 5 万组图像-文本对,仅需每个图像 49KB 磁盘存储,零样本 Flickr 以及微调 COCO 检索性能与先前工作持平。

关键词

引用

@article{arxiv.2510.06820,
  title  = {Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking},
  author = {Mitchell Keren Taraday and Shahaf Wagner and Chaim Baskin},
  journal= {arXiv preprint arXiv:2510.06820},
  year   = {2026}
}

备注

Accepted at ICLR 2026