通用图像检索的高效且具辨别力的图像特征提取
计算机视觉与模式识别
2024-09-23 v1
摘要
当前的图像检索系统常面临领域特定性和泛化性问题。本研究旨在通过开发一个计算高效的训练框架,构建一个通用特征提取器,提供跨各种领域的强语义图像表示。为此,我们精选了一个多领域训练数据集,称为 M4D-35k,允许资源高效的训练。此外,我们对 various state-of-the-art 视觉语义基础模型和基于边际的度量学习损失函数进行了广泛的评估和比较,探讨其对于高效通用特征提取的适用性。尽管计算资源有限,我们在 Google Universal Image Embedding 挑战中实现了接近最先进的结果,mMP@5 为 0.721。这将我们的方法置于排名第二,仅落后于最佳方法 0.7 个百分点。然而,我们的模型总体参数数目减少了 32%,可训练参数数目减少了 289 倍。与计算需求相似的方法相比,我们以 3.3 个百分点的优势超越了前所未有的状态。我们在 https://github.com/morrisfl/UniFEx 上发布了代码和 M4D-35k 训练集标注。
引用
@article{arxiv.2409.13513,
title = {Efficient and Discriminative Image Feature Extraction for Universal Image Retrieval},
author = {Morris Florek and David Tschirschwitz and Björn Barz and Volker Rodehorst},
journal= {arXiv preprint arXiv:2409.13513},
year = {2024}
}