GoMatching:通过长短期匹配实现视频文本识别的简单基线
计算机视觉与模式识别
2024-10-10 v2
摘要
超越图像文本识别中的文本检测与识别任务,视频文本识别因包含跟踪而呈现出更大的挑战。尽管先进的端到端可训练方法已展现出值得称道的性能,但追求多任务优化可能带来为单个任务产生次优结果的风险。在本文中,我们识别出当前最先进的视频文本识别器的一个主要瓶颈:有限的识别能力。为应对这一问题,我们提出将现成的基于查询的图像文本识别器高效地转变为视频领域的专家,并呈现一个名为GoMatching的简单基线,它将训练重点集中在跟踪上,同时保持强大的识别性能。为使图像文本识别器适应视频数据集,我们添加了一个重打分头,通过高效微调对每个检测到的实例的置信度进行重新打分,从而获得更好的跟踪候选池。此外,我们设计了一个长短期匹配模块,称为LST-Matcher,通过Transformer整合长期和短期匹配结果来增强识别器的跟踪能力。基于上述简单设计,GoMatching在ICDAR15-video、DSText、BOVText以及我们提出的包含任意形状文本的新测试集ArTVideo上均创下了新纪录,展示了GoMatching在适应一般、密集、小尺寸、任意形状、中英文文本场景方面的能力,同时节省了大量的训练预算。
引用
@article{arxiv.2401.07080,
title = {GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching},
author = {Haibin He and Maoyuan Ye and Jing Zhang and Juhua Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2401.07080},
year = {2024}
}