GLASS:面向场景文本 spotting 的全局到局部注意力
计算机视觉与模式识别
2022-08-09 v1 人工智能
摘要
近年来,文本 spotting 的主流范式是将文本检测与识别任务组合进单一的端到端框架。在此范式下,两项任务均通过对从输入图像提取的共享全局特征图进行操作来完成。端到端方法面临的主要挑战之一是在跨尺度变化(更小或更大的文本)及任意单词旋转角度下识别文本时的性能退化。本工作中,我们通过提出一种新颖的用于文本 spotting 的全局到局部注意力机制(称为GLASS)来解决这些挑战,其将全局与局部特征相融合。全局特征从共享骨干网络提取,保留整幅图像的上下文信息,而局部特征则在调整尺寸的高分辨率旋转单词裁剪上单独计算。从局部裁剪提取的信息缓解了尺度与单词旋转带来的诸多固有困难。我们给出了跨尺度与角度的性能分析,突出在尺度与角度极端情况下的改进。此外,我们引入一项方向感知损失项来监督检测任务,并展示其对各角度下检测与识别性能的贡献。最后,我们表明GLASS具有通用性,通过将其整合进其他领先的文本 spotting 架构,提升了它们的文本 spotting 性能。我们的方法在包括新发布的TextOCR在内的多个基准上取得了SOTA结果。
引用
@article{arxiv.2208.03364,
title = {GLASS: Global to Local Attention for Scene-Text Spotting},
author = {Roi Ronen and Shahar Tsiper and Oron Anschel and Inbal Lavi and Amir Markovitz and R. Manmatha},
journal= {arXiv preprint arXiv:2208.03364},
year = {2022}
}
备注
23 pages, 9 figures, ECCV'22