面向对象级开放词汇图像检索的微调——FOR
计算机视觉与模式识别
2024-12-30 v1 信息检索
机器学习
摘要
随着大规模数据集的使用变为标准,准确检索包含感兴趣对象且以开放文本查询为条件的图像的任务变得具有实际重要性。当前领先的方法利用预训练的 CLIP 模型进行微调,通过额外的后处理在准确性和效率之间进行权衡。本文提出了 FOR:面向对象的开放词汇图像检索的微调,允许在使用封闭集标签的同时进行目标数据集上的微调,同时保持视觉-语言关联对于开放词汇检索至关重要。FOR 基于两个设计要素:针对旨定任务定制的 CLIP 头部的专用解码器变体,以及其在多目标训练框架中的耦合。这些设计选择结果显著提高了准确性,在三个数据集上相较于 SoTA 实现了最高可达 8 分的 mAP@50 改进。此外,我们展示了 FOR 在半监督设置中也同样有效,即使仅有数据集的很小一部分被标记也能取得令人印象深刻的结果。
引用
@article{arxiv.2412.18806,
title = {FOR: Finetuning for Object Level Open Vocabulary Image Retrieval},
author = {Hila Levi and Guy Heller and Dan Levi},
journal= {arXiv preprint arXiv:2412.18806},
year = {2024}
}
备注
WACV 2025