GoMatching++:参数与数据高效的任意形状视频文本定位与基准测试
计算机视觉与模式识别
2026-01-01 v2
摘要
视频文本定位(VTS)通过在图像文本定位(ITS)基础上增加文本跟踪,显著增加了任务复杂度。尽管VTS取得了进展,但现有方法在性能上仍不及ITS。本文指出了当前视频文本定位器的一个关键局限性:识别能力有限,即使在经过广泛的端到端训练后也是如此。为了解决这个问题,我们提出了GoMatching++,这是一种参数与数据高效的方法,可将现成的图像文本定位器转化为视频专用模型。其核心思想在于冻结图像文本定位器并引入一个轻量级、可训练的跟踪器,该跟踪器可以通过最少的训练数据被高效优化。我们的方法包含两个关键组件:(1)一种重打分机制,用于弥合图像和视频数据之间的领域差距;以及(2)LST-Matcher,用于增强被冻结的图像文本定位器处理视频文本的能力。我们探索了LST-Matcher的各种架构,以确保在参数和训练数据上的双重效率。因此,GoMatching++在ICDAR15-video、DSText和BOVText等具有挑战性的基准测试上创造了新的性能记录,同时显著降低了训练成本。为了解决VTS中缺乏弯曲文本数据集的问题,我们引入了ArTVideo,这是一个新基准测试,包含超过30%的弯曲文本并带有详细标注。我们还提供了ArTVideo的全面统计分析和实验结果。我们相信GoMatching++和ArTVideo基准测试将推动视频文本定位的未来发展。源代码、模型和数据集已在 https://github.com/Hxyz-123/GoMatching 公开发布。
引用
@article{arxiv.2505.22228,
title = {GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking},
author = {Haibin He and Jing Zhang and Maoyuan Ye and Juhua Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2505.22228},
year = {2026}
}