将 CLIP 模型转化为场景文本 spotting 器
计算机视觉与模式识别
2023-08-22 v1
摘要
我们挖掘大规模对比语言-图像预训练 (CLIP) 模型的潜力,以增强场景文本检测与 spotting 任务,将其转化为一个鲁棒骨干网络 FastTCM-CR50。该骨干利用 CLIP 中的视觉提示学习与交叉注意力来提取基于图像与文本的先验知识。通过预定义与可学习的提示,FastTCM-CR50 引入实例-语言匹配过程以增强图像与文本嵌入间的协同,从而精炼文本区域。我们的双模态相似度匹配 (BSM) 模块促进动态语言提示生成,支持离线计算并提升性能。FastTCM-CR50 具有若干优势:1) 可增强现有文本检测器与 spotter,分别平均提升 1.7% 与 1.5% 性能。2) 优于先前的 TCM-CR50 骨干,在文本检测与 spotting 任务上分别平均提升 0.2% 与 0.56%,且推理速度提升 48.5%。3) 展现出鲁棒的少样本训练能力。仅使用 10% 监督数据,FastTCM-CR50 在文本检测与 spotting 任务上分别平均提升 26.5% 与 5.5%。4) 在分布外文本检测与 spotting 数据集上持续提升性能,特别是来自 ICDAR2019-ArT 的 NightTime-ArT 子集与用于有向目标检测的 DOTA 数据集。代码见 https://github.com/wenwenyu/TCM。
引用
@article{arxiv.2308.10408,
title = {Turning a CLIP Model into a Scene Text Spotter},
author = {Wenwen Yu and Yuliang Liu and Xingkui Zhu and Haoyu Cao and Xing Sun and Xiang Bai},
journal= {arXiv preprint arXiv:2308.10408},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2302.14338