中文

蒸馏视觉-语言预训练以实现高效跨模态检索

计算机视觉与模式识别 2024-05-24 v1

摘要

“学习哈希”是一种实用的高效检索解决方案,具有快速搜索速度和低存储成本。它广泛应用于各种应用,如图像-文本跨模态搜索。本文探讨了利用强大的大型预训练模型(如视觉-语言预训练(VLP)模型)来增强学习哈希性能的潜力。我们提出了一种名为跨模态量化蒸馏(DCMQ)的新方法,该方法利用VLP模型的丰富语义知识来改进哈希表示学习。具体来说,我们将VLP作为“教师”,将知识蒸馏到配备码本的“学生”哈希模型中。该过程涉及用VLP的丰富语义替换由多热向量组成且缺乏语义的监督标签。最后,我们应用一种称为配对一致性归一化(NPC)的变换,以获得用于蒸馏的判别性目标。此外,我们引入了一种新的量化方法——Gumbel乘积量化(PQG),它促进了平衡的码本学习,从而提高了检索性能。广泛的基准测试表明,DCMQ始终优于现有的监督跨模态哈希方法,展示了其巨大的潜力。

关键词

引用

@article{arxiv.2405.14726,
  title  = {Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval},
  author = {Young Kyun Jang and Donghyun Kim and Ser-nam Lim},
  journal= {arXiv preprint arXiv:2405.14726},
  year   = {2024}
}