迈向统一多粒度文本检测的交互注意力方法
计算机视觉与模式识别
2024-05-31 v1 人工智能
摘要
现有的OCR引擎或文档图像分析系统通常依赖于训练单独的模型来处理不同场景和粒度下的文本检测,导致显著的计算复杂度和资源需求。在本文中,我们引入了“Detect Any Text”(DAT),一种先进的范式,将场景文本检测、版面分析和文档页面检测无缝统一到一个内聚的端到端模型中。这种设计使DAT能够高效地管理不同粒度的文本实例,包括单词、行、段落和页面。DAT的一个关键创新是跨粒度交互注意力模块,通过关联不同文本查询之间的结构信息,显著增强了不同粒度文本实例的表示学习。因此,它使模型能够在多个文本粒度上实现互利的检测性能。此外,基于提示的分割模块优化了任意曲率和复杂布局的文本的检测结果,从而提高了DAT的准确性并扩展了其实际应用性。实验结果表明,DAT在各种文本相关基准测试中达到了最先进的性能,包括多方向/任意形状的场景文本检测、文档版面分析和页面检测任务。
引用
@article{arxiv.2405.19765,
title = {Towards Unified Multi-granularity Text Detection with Interactive Attention},
author = {Xingyu Wan and Chengquan Zhang and Pengyuan Lyu and Sen Fan and Zihan Ni and Kun Yao and Errui Ding and Jingdong Wang},
journal= {arXiv preprint arXiv:2405.19765},
year = {2024}
}
备注
ICML 2024