中文

基于 PP-YOLOE-R 与 SORT 算法的小目标密集视频文本跟踪

计算机视觉与模式识别 2023-04-04 v1

摘要

尽管基于 Transformer 的端到端视频文本 spotting 方法能够建模长程依赖并简化训练过程,但随着输入视频中帧尺寸的增大,其计算开销也会显著增加。因此,考虑到 ICDAR 2023 DSText 的分辨率为 1080*1920,且将视频帧切分为若干区域会破坏文本的空间相关性,我们将小且密集的文本 spotting 划分为文本检测与跟踪两项任务。对于文本检测,我们采用在小型目标检测中被证明有效的 PP-YOLOE-R 作为检测模型。对于文本跟踪,我们使用 SORT 算法以获得高推理速度。在 DSText 数据集上的实验表明,我们的方法在小且密集的文本 spotting 上具有竞争力。

关键词

引用

@article{arxiv.2304.00018,
  title  = {Video text tracking for dense and small text based on pp-yoloe-r and sort algorithm},
  author = {Hongen Liu},
  journal= {arXiv preprint arXiv:2304.00018},
  year   = {2023}
}