SAViL-Det:面向多脚本文本检测的语义感知视觉语言模型
计算机视觉与模式识别
2025-07-29 v1
摘要
检测自然场景中的文本仍然具有挑战性,尤其是对于多样化的脚本和任意形状的实例,由于视觉线索往往不足。现有方法未充分利用语义上下文。本文引入了 SAViL-Det,一种新颖的语义感知视觉语言模型,通过有效地将文本提示与视觉特征集成,增强了多脚本文本检测。SAViL-Det 利用预训练的 CLIP 模型结合渐近特征金字塔网络(AFPN)进行多尺度视觉特征融合。本文框架的核心是一种新颖的语言-视觉解码器,通过跨模态注意力机制适应性地将文本提示中的细粒度语义信息传递到视觉特征中。此外,提出了一种文本到像素的对比学习机制,显式地对齐文本特征与相应的视觉像素特征。大量实验在具有挑战性的基准数据集上表明,所提方法有效地实现了最先进的性能,在多语言 MLT-2019 数据集上实现 84.8% 的 F 分数,在曲线文本 CTW1500 数据集上实现 90.2% 的 F 分数。
引用
@article{arxiv.2507.20188,
title = {SAViL-Det: Semantic-Aware Vision-Language Model for Multi-Script Text Detection},
author = {Mohammed-En-Nadhir Zighem and Abdenour Hadid},
journal= {arXiv preprint arXiv:2507.20188},
year = {2025}
}