基于Transformer的端到端视频文本 spotting
计算机视觉与模式识别
2022-08-23 v3 人工智能
摘要
现有的视频文本spotting方法通常需要三阶段流水线,即在单帧图像中检测文本、识别定位文本、通过后处理跟踪文本流以生成最终结果。这些方法通常遵循匹配式跟踪范式并设计复杂的流水线。本文基于Transformer序列建模,提出了一种简单而有效的端到端视频文本检测、跟踪与识别框架(TransDETR)。TransDETR主要包括两点优势:1)不同于相邻帧间的显式匹配范式,TransDETR通过称为文本查询的不同查询在长时序(超过7帧)上隐式地跟踪和识别每个文本。2)TransDETR是首个端到端可训练的视频文本spotting框架,同时解决三个子任务(如文本检测、跟踪、识别)。在四个视频文本数据集(即ICDAR2013 Video、ICDAR2015 Video、Minetto和YouTube Video Text)上进行了大量实验,表明TransDETR在视频文本spotting任务上取得了最先进的性能,提升高达约8.0%。TransDETR的代码可在https://github.com/weijiawu/TransDETR找到。
引用
@article{arxiv.2203.10539,
title = {End-to-End Video Text Spotting with Transformer},
author = {Weijia Wu and Yuanqiang Cai and Chunhua Shen and Debing Zhang and Ying Fu and Hong Zhou and Ping Luo},
journal= {arXiv preprint arXiv:2203.10539},
year = {2022}
}
备注
10 pages, 5 figures