中文

如何让跨编码器成为高效图像-文本检索中的优秀教师?

计算机视觉与模式识别 2024-07-11 v1

摘要

占主导地位的双编码器模型能够实现高效的图像-文本检索,但因准确率有限;而跨编码器模型在牺牲效率的同时提供更高的准确率。从跨编码器蒸馏到双编码器的跨模态匹配知识,提供了自然的做法,旨在发挥两者的优势。因此,我们研究了以下关键问题:如何让跨编码器成为双编码器的优秀教师?我们的发现包含三点:(1) 跨编码器的跨模态相似度得分分布更集中,而双编码器的结果几乎呈正态分布,这使得普通逻辑蒸馏效果较差。然而,排序蒸馏仍然实用,因为其不受得分分布影响。(2) 只有硬负样本之间的相对顺序传递有效知识,而软负样本之间的顺序信息几乎无关紧要。(3) 在蒸馏损失与双编码器训练损失之间保持协调,有助于知识传递。基于这些发现,我们提出了一种新颖的方法——对比部分排序蒸馏(CPRD),通过对抗学习实现对硬负样本相对顺序的模拟。该方法与双编码器的训练协调有效,将有效知识从跨编码器传递到双编码器。在图像-文本检索和排序任务上的大量实验表明,我们的方法优于其他蒸馏方法,显著提升了双编码器的准确率。

关键词

引用

@article{arxiv.2407.07479,
  title  = {How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?},
  author = {Yuxin Chen and Zongyang Ma and Ziqi Zhang and Zhongang Qi and Chunfeng Yuan and Bing Li and Junfu Pu and Ying Shan and Xiaojuan Qi and Weiming Hu},
  journal= {arXiv preprint arXiv:2407.07479},
  year   = {2024}
}

备注

Accepted by CVPR 2024