利用神经网络从社交媒体视频中提取文字叠加层
计算机视觉与模式识别
2018-05-02 v2
摘要
社交媒体视频中常使用文字叠加层,因为无声观看的用户会错过音频流中传达的重要信息。因此,提取这些叠加层可作为重要的元数据来源,例如用于内容分类或检索任务。在这项工作中,我们提出了一种基于多种神经网络架构的从视频中提取文字叠加层的鲁棒方法。所提出的方案依赖若干处理步骤:关键帧提取、文本检测与文本识别。我们系统的核心组件即文本识别模块,受卷积循环神经网络架构启发,并且我们使用作者专门为此任务合成的包含超过 600,000 张带文本图像的数据集提升了其性能。我们还开发了一种利用莱文斯坦距离减少重叠文本短语数量的过滤方法,进一步提升了系统性能。我们方案的最终准确率超过 80% 并与最先进方法相当。
引用
@article{arxiv.1804.10687,
title = {Extracting textual overlays from social media videos using neural networks},
author = {Adam Słucki and Tomasz Trzcinski and Adam Bielski and Paweł Cyrta},
journal= {arXiv preprint arXiv:1804.10687},
year = {2018}
}
备注
International Conference on Computer Vision and Graphics (ICCVG) 2018