中文

FlowText:基于光流估计合成真实场景文本视频

计算机视觉与模式识别 2023-05-08 v1

摘要

当前的视频文本 spotting 方法在充足标注训练数据的支撑下能够取得较好的性能。然而,人工标注数据耗时耗力。为克服这一问题,使用低成本的合成数据是一种有前景的替代方案。本文提出了一种名为 FlowText 的新型视频文本合成技术,其利用光流估计以低成本合成大量文本视频数据,用于训练鲁棒的视频文本 spotter。与现有聚焦于图像级合成的方法不同,FlowText 专注于利用光流合成连续帧间文本实例的时序信息。该时序信息对于视频序列中文本的准确跟踪与 spotting 至关重要,包括文本运动、形变、出现、消失、遮挡与模糊。实验表明,将 TransDETR 等通用检测器与所提 FlowText 结合,在 ICDAR2015video 与 ICDAR2013video 等多种数据集上取得了显著结果。代码已发布于 https://github.com/callsys/FlowText。

关键词

引用

@article{arxiv.2305.03327,
  title  = {FlowText: Synthesizing Realistic Scene Text Video with Optical Flow Estimation},
  author = {Yuzhong Zhao and Weijia Wu and Zhuang Li and Jiahong Li and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2305.03327},
  year   = {2023}
}