Text-Pass Filter:一种高效的场景文本检测器
计算机视觉与模式识别
2026-01-27 v1
摘要
为了追求高效的文本组装过程,现有方法通过收缩掩码扩展策略检测文本。然而,收缩操作丢失了文本边缘的视觉特征,并混淆了前景与背景的差异,这给识别文本特征带来了固有的局限性。我们针对此问题,设计了用于任意形状文本检测的Text-Pass Filter(TPF)。它直接分割整个文本,避免了固有的局限性。值得注意的是,与以往基于整个文本区域的方法不同,TPF能够自然地分离粘连文本,无需复杂的解码或后处理过程,这使得实时文本检测成为可能。具体而言,我们发现带通滤波器允许特定频带(称为通带)内的分量通过,但阻止该频带之上或之下的分量。这为分别提取整个文本提供了一个自然的思路。通过模拟带通滤波器,TPF为每个文本构建了独特的特征-滤波器对。在推理阶段,每个滤波器通过通过其通带特征并阻止其他特征来提取相应的匹配文本。同时,考虑到带状文本的大长宽比问题使得难以完整识别文本,我们设计了强化集成单元(REU)以增强同一文本的特征一致性,并扩大滤波器的识别域以帮助识别整个文本。此外,引入了前景先验单元(FPU)以鼓励TPF区分前景与背景之间的差异,从而提高特征-滤波器对的质量。实验证明了REU和FPU的有效性,同时展示了TPF的优越性。
引用
@article{arxiv.2601.18098,
title = {Text-Pass Filter: An Efficient Scene Text Detector},
author = {Chuang Yang and Haozhao Ma and Xu Han and Yuan Yuan and Qi Wang},
journal= {arXiv preprint arXiv:2601.18098},
year = {2026}
}