中文

关于深度度量学习的三个方面

计算机视觉与模式识别 2024-12-18 v1 人工智能

摘要

本文研究用于开集图像检索的有监督深度度量学习,重点关注三个关键方面:损失函数、mixup 正则化与模型初始化。在深度度量学习中,通过梯度下降优化检索评估指标 recall@k 是理想的,但由于其不可微性而充满挑战。为克服这一点,我们提出了一种在大批次上计算的可微替代损失,该批次几乎等同于整个训练集。这一计算密集的过程通过绕过 GPU 内存限制的实现而变得可行。此外,我们引入了一种高效的 mixup 正则化技术,该技术作用于成对标量相似度,进一步有效增大了批次大小。通过使用在大规模数据集上预训练的基础模型初始化视觉编码器,训练过程得到了进一步增强。通过对这些组件的系统研究,我们证明了它们的协同作用使得大型模型能够近乎解决流行的基准测试。

关键词

引用

@article{arxiv.2412.12432,
  title  = {Three Things to Know about Deep Metric Learning},
  author = {Yash Patel and Giorgos Tolias and Jiri Matas},
  journal= {arXiv preprint arXiv:2412.12432},
  year   = {2024}
}