基于 PP-YOLOE-R 与 SORT 算法的小目标密集视频文本跟踪
计算机视觉与模式识别
2023-04-04 v1
摘要
尽管基于 Transformer 的端到端视频文本 spotting 方法能够建模长程依赖并简化训练过程,但随着输入视频中帧尺寸的增大,其计算开销也会显著增加。因此,考虑到 ICDAR 2023 DSText 的分辨率为 1080*1920,且将视频帧切分为若干区域会破坏文本的空间相关性,我们将小且密集的文本 spotting 划分为文本检测与跟踪两项任务。对于文本检测,我们采用在小型目标检测中被证明有效的 PP-YOLOE-R 作为检测模型。对于文本跟踪,我们使用 SORT 算法以获得高推理速度。在 DSText 数据集上的实验表明,我们的方法在小且密集的文本 spotting 上具有竞争力。
引用
@article{arxiv.2304.00018,
title = {Video text tracking for dense and small text based on pp-yoloe-r and sort algorithm},
author = {Hongen Liu},
journal= {arXiv preprint arXiv:2304.00018},
year = {2023}
}