聚焦、区分、提示:释放 CLIP 的高效与灵活场景文本检索能力
计算机视觉与模式识别
2024-08-02 v1 人工智能
摘要
场景文本检索旨在从图像画廊中查找包含查询文本的所有图像。当前方法倾向于采用光字符识别(OCR)管道,需复杂的文本检测和/或识别过程,导致检索效率低且缺乏灵活性。与此不同,本文提出探索 CLIP(Contrastive Language-Image Pre-training)的内在潜力,用于无 OCR 场景文本检索。通过实证分析,我们观察到 CLIP 作为文本检索器的主要挑战是:1)文本感知尺度受限,2)视觉-语义概念交织。为此,我们开发了一种新型模型,称为 FDP(Focus, Distinguish, and Prompt)。FDP 首先通过转移注意力至文本区域并探测隐藏文本知识来聚焦场景文本,然后将查询文本分为内容词和功能词进行处理,其中利用语义感知的提示方案和干扰查询辅助模块。大量实验表明,FDP 在推理速度上显著提升,同时在检索准确率上优于或相当于现有方法。值得注意的是,在 IIIT-STR 数据集上,FDP 相比最新方法快 4 倍,准确率提升 4.37%。此外,额外的短语级和属性感知场景文本检索实验验证了 FDP 在处理多样化查询文本形式方面的独特优势。源代码将公开于 https://github.com/Gyann-z/FDP。
引用
@article{arxiv.2408.00441,
title = {Focus, Distinguish, and Prompt: Unleashing CLIP for Efficient and Flexible Scene Text Retrieval},
author = {Gangyan Zeng and Yuan Zhang and Jin Wei and Dongbao Yang and Peng Zhang and Yiwen Gao and Xugong Qin and Yu Zhou},
journal= {arXiv preprint arXiv:2408.00441},
year = {2024}
}
备注
Accepted by ACM MM 2024