中文

LOGO:基于语言协作与字形感知模型的视频文本检测

计算机视觉与模式识别 2024-06-13 v2

摘要

视频文本检测(VTS)旨在视频中同时定位、识别和跟踪文本实例。为解决端到端方法的识别能力有限,最近的 метод们直接跟踪来自最新图像文本检测器的零样体结果,取得了令人印象的性能。然而,由于不同数据集之间的领域差异,这些方法通常在极端数据集上获得有限的跟踪轨迹。对特定数据集上的基于转换器的文本检测器进行微调可获得性能提升,但需要相当大的训练资源。本文提出了一种语言协作和字形感知模型,称为 LOGO,旨在增强常规文本检测器的性能。为实现此目标,我们设计了语言协作分类器(LSC),用于在识别阶段明确区分文本实例与背景噪声。特殊地,语言协作分类器可以基于文本区域的可读性输出文本内容或背景代码,从而计算语言分数。随后,计算由检测分数和语言分数平均得到的融合分数,并用于在跟踪之前重新对检测结果进行打分。通过该重新打分机制,提出的 LSC 有助于检测低分辨率文本实例,同时过滤掉类文本区域。此外,引入字形监督以增强噪声文本区域的识别准确性。我们还提出了视觉位置混合模块,该模块能够有效地合并位置信息和视觉特征,获取更具辨识力的跟踪特征。在公共基准测试上进行大量实验验证了所提出方法的有效性。

关键词

引用

@article{arxiv.2405.19194,
  title  = {LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model},
  author = {Hongen Liu and Di Sun and Jiahao Wang and Yi Liu and Gang Pan},
  journal= {arXiv preprint arXiv:2405.19194},
  year   = {2024}
}