面向视频文本 spotting 的可扩展掩码标注
计算机视觉与模式识别
2023-05-03 v1 人工智能
摘要
视频文本 spotting 指的是在连续视频帧中定位、识别并跟踪字幕、标志、车牌、标牌以及其他文本形式的文字元素。然而,当前可用于该任务的数据集依赖于四边形真值标注,这可能导致包含过多背景内容以及文本边界不准确。此外,在这些数据集上训练的方法通常产生四边形框形式的预测结果,这限制了它们处理密集或弯曲文本等复杂场景的能力。为解决这些问题,我们提出了一种名为 SAMText 的可扩展掩码标注流水线,用于视频文本 spotting。SAMText 利用 SAM 模型大规模地为场景文本图像或视频帧生成掩码标注。使用 SAMText,我们构建了一个大规模数据集 SAMText-9M,包含来自现有数据集的超过 2400 个视频片段以及超过 900 万个掩码标注。我们还对生成的掩码及其质量进行了详尽的统计分析,并基于该数据集确定了若干可进一步探索的研究课题。代码与数据集将在 \url{https://github.com/ViTAE-Transformer/SAMText} 发布。
引用
@article{arxiv.2305.01443,
title = {Scalable Mask Annotation for Video Text Spotting},
author = {Haibin He and Jing Zhang and Mengyang Xu and Juhua Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2305.01443},
year = {2023}
}
备注
Technical report. Work in progress