用于上下文文本块检测的动态关系 Transformer
计算机视觉与模式识别
2024-01-18 v1
摘要
上下文文本块检测(CTBD)是指在自然场景的复杂性中识别连贯文本块的任务。以往的方法要么将 CTBD 视为计算机视觉中的视觉关系提取挑战,要么从自然语言处理的角度将其视为序列建模问题。我们提出了一个新框架,将 CTBD 构建为图生成问题。该方法包含两个基本步骤:将单个文本单元识别为图节点,并辨别这些单元之间的顺序阅读关系作为图边。利用 DQ-DETR 在节点检测方面的前沿能力,我们的框架进一步创新,集成了一种专用于边生成的新机制——动态关系 Transformer(DRFormer)。DRFormer Incorporates 一个双重交互式 Transformer 解码器,巧妙地管理动态图结构细化过程。通过这一迭代过程,模型系统地提高了图的保真度,最终提升了检测上下文文本块的精度。在 SCUT-CTW-Context 和 ReCTS-Context 数据集上进行的全面实验评估证实,我们的方法取得了最先进(SOTA)的结果,突显了我们的图生成框架在推动 CTBD 领域发展方面的有效性和潜力。
引用
@article{arxiv.2401.09232,
title = {Dynamic Relation Transformer for Contextual Text Block Detection},
author = {Jiawei Wang and Shunchi Zhang and Kai Hu and Chixiang Ma and Zhuoyao Zhong and Lei Sun and Qiang Huo},
journal= {arXiv preprint arXiv:2401.09232},
year = {2024}
}