用于场景文本检测的聚合文本 Transformer
计算机视觉与模式识别
2024-06-05 v2
摘要
本文探讨了自然图像中场景文本检测的多尺度聚合策略。我们提出了聚合文本 Transformer(ATTR),其设计旨在通过多尺度自注意力机制表示场景图像中的文本。从具有多分辨率的图像金字塔出发,特征首先以共享权重在不同尺度上提取,然后送入 Transformer 的编码器-解码器架构。多尺度图像表示具有鲁棒性并包含各种尺寸文本内容的丰富信息。文本 Transformer 聚合这些特征以学习跨尺度的交互并改进文本表示。所提方法通过将每个文本实例表示为独立的二值掩码来检测场景文本,其对曲线文本和密集实例区域具有容忍性。在公开场景文本检测数据集上的大量实验证明了该框架的有效性。
引用
@article{arxiv.2211.13984,
title = {Aggregated Text Transformer for Scene Text Detection},
author = {Zhao Zhou and Xiangcheng Du and Yingbin Zheng and Cheng Jin},
journal= {arXiv preprint arXiv:2211.13984},
year = {2024}
}