中文

高效 SBIR 模型配方:相对三元组损失与批量归一化及知识蒸馏的结合

计算机视觉与模式识别 2023-05-31 v1 信息检索

摘要

基于草图的图像检索(SBIR)是多媒体检索中的关键任务,其目标是检索与给定草图查询匹配的一组图像。研究者已提出若干性能良好的解决方案,但大多聚焦于通过不同方法(如三元组损失、四元组损失、添加数据增强以及使用边缘提取)来增强嵌入。在本工作中,我们从多个角度解决该问题。我们首先考察训练数据质量并展示其若干局限。随后,我们引入相对三元组损失(RTL),一种改进的三元组损失,通过基于锚点相似度的损失加权来克服这些局限。通过一系列实验,我们证明用 RTL 替换三元组损失可在无需任何数据增强的情况下优于先前的最先进水平。此外,我们论证了批量归一化比 l2 归一化更适用于 SBIR 嵌入,并展示其显著提升了模型性能。我们进一步研究了照片与草图域所需模型容量,证明照片编码器比草图编码器需要更高容量,这验证了 [34] 中提出的假设。然后,我们提出一种直接方法,通过知识蒸馏高效训练小型模型(如 ShuffleNetv2 [22]),精度损失微小。将相同方法用于更大模型使我们超越先前最先进结果,并在 The Sketchy Database [30] 上于 k = 1 时达到 62.38% 的召回率。

关键词

引用

@article{arxiv.2305.18988,
  title  = {A Recipe for Efficient SBIR Models: Combining Relative Triplet Loss with Batch Normalization and Knowledge Distillation},
  author = {Omar Seddati and Nathan Hubens and Stéphane Dupont and Thierry Dutoit},
  journal= {arXiv preprint arXiv:2305.18988},
  year   = {2023}
}