中文

GloTSFormer:全局视频文本定位 Transformer

计算机视觉与模式识别 2024-01-09 v1 人工智能

摘要

视频文本定位(VTS)是一项基础的视觉任务,旨在预测视频中文字的轨迹与内容。以往的工作通常进行局部关联,并应用基于 IoU 的距离和复杂的后处理流程来提升性能,忽略了 VTS 中丰富的时序信息与形态特征。在本文中,我们提出了一种新型全局视频文本定位 Transformer GloTSFormer,将跟踪问题建模为全局关联,并利用高斯 Wasserstein 距离来指导帧间的形态关联。我们的主要贡献可概括为三个方面。1). 我们提出了一种用于 VTS 的基于 Transformer 的全局跟踪方法 GloTSFormer,可同时关联多帧。2). 我们引入了一种基于 Wasserstein 距离的方法来进行帧间的位置关联。3). 我们在公开数据集上进行了大量实验。在 ICDAR2015 视频数据集上,GloTSFormer 取得了 56.0 MOTA,相比之前的 SOTA 方法有 4.6 的绝对提升,并以显著的 8.3 MOTA 优势超越了之前基于 Transformer 的方法。

关键词

引用

@article{arxiv.2401.03694,
  title  = {GloTSFormer: Global Video Text Spotting Transformer},
  author = {Han Wang and Yanjie Wang and Yang Li and Can Huang},
  journal= {arXiv preprint arXiv:2401.03694},
  year   = {2024}
}