ZeroSearch:基于零样本学习的文本驱动本地图像搜索
计算机视觉与模式识别
2023-05-02 v1
摘要
由于个人设备上拍摄的图像数量快速增长,在用户目录中整理和查找图像的问题变得日益具有挑战性。本文提出了一种利用零样本学习、仅通过用户提供的文本描述来创建图像查询的解决方案。论文的主要贡献是开发了一种利用预训练模型从图像中提取特征的算法。该算法使用 OWL 检测边界框的存在,并基于余弦相似度得分对图像进行排序。算法的输出是按相似度降序排列的图像列表,帮助用户更高效地定位特定图像。论文实验使用自定义数据集模拟用户图像目录,并评估了模型的准确率、推理时间和大小。结果表明,VGG 模型取得了最高准确率,而 Resnet50 和 InceptionV3 模型的推理时间和模型大小最低。本文提出的算法为整理和查找用户本地目录中的图像提供了有效且高效的方案。该算法的性能和灵活性使其适用于多种应用,包括个人图像整理和搜索引擎。Zero-search 的代码和数据集可在 https://github.com/NainaniJatinZ/zero-search 获取。
引用
@article{arxiv.2305.00715,
title = {ZeroSearch: Local Image Search from Text with Zero Shot Learning},
author = {Jatin Nainani and Abhishek Mazumdar and Viraj Sheth},
journal= {arXiv preprint arXiv:2305.00715},
year = {2023}
}
备注
8 pages, 8 figures