大规模视觉语言重排序的高效判别性联合编码器
计算机视觉与模式识别
2026-02-24 v2 机器学习
摘要
多模态检索仍依赖于基于嵌入的模型如 CLIP 用于预计算图像嵌入的快速向量搜索。然而,与文本检索相比,联合编码器 reranker 在视觉语言领域几乎缺席。我们发现,诸如 BLIP 等关键联合编码器受限于昂贵的视觉特征提取阶段,难以在大规模场景中实际部署。为突破这一瓶颈,我们引入 EDJE(Efficient Discriminative Joint Encoder),该模型在离线预计算视觉标记后通过轻量级注意力适配器进行压缩,使得在线推理仅需对小型视觉标记集合和文本进行紧凑的联合编码。EDJE 保持强大的检索性能,同时大幅降低存储需求和在线计算量,实现高吞吐量推理。具体而言,EDJE 能处理每秒 5 万组图像-文本对,仅需每个图像 49KB 磁盘存储,零样本 Flickr 以及微调 COCO 检索性能与先前工作持平。
引用
@article{arxiv.2510.06820,
title = {Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking},
author = {Mitchell Keren Taraday and Shahaf Wagner and Chaim Baskin},
journal= {arXiv preprint arXiv:2510.06820},
year = {2026}
}
备注
Accepted at ICLR 2026