深度度量学习中的大至小图像分辨率非对称性
计算机视觉与模式识别
2022-10-12 v1
摘要
视觉深度度量学习通过优化表征网络来训练,将(非)匹配图像对映射至(非)相似表征。在通常对应于图像检索的测试阶段,数据库与查询样本均由同一网络处理以获取用于相似性估计与排序的表征。本文探索了一种非对称设置,即以小分辨率对查询样本进行轻量化处理,从而实现快速表征提取。其目标是获得一个用于数据库样本的网络,该网络被训练在高分辨率图像上运行并受益于细粒度的图像细节;同时获得第二个用于查询样本的网络,该网络在小分辨率图像上运行,但保持与数据库网络对齐的表征空间。我们通过一种蒸馏方法实现了这一点,该方法将知识从固定的教师网络转移至学生网络,所使用的损失函数逐图像操作,且仅依赖耦合的数据增强而不使用任何标签。与以往从不同网络架构角度探索此类非对称性的工作不同,本文使用相同的架构但改变图像分辨率。我们得出结论,分辨率非对称性是比架构非对称性更好的优化性能/效率权衡的方式。在三个标准深度度量学习基准上进行了评估,即 CUB200、Cars196 和 SOP。代码:https://github.com/pavelsuma/raml
引用
@article{arxiv.2210.05463,
title = {Large-to-small Image Resolution Asymmetry in Deep Metric Learning},
author = {Pavel Suma and Giorgos Tolias},
journal= {arXiv preprint arXiv:2210.05463},
year = {2022}
}
备注
WACV 2023