基于多尺度 Weber 局部描述符的视频文本定位
计算机视觉与模式识别
2016-11-17 v1
摘要
本文提出了一种基于多尺度 Weber 局部描述符(MWLD)的新方法,用于检测视频和场景图像中的文本。给定输入视频,首先根据其时空关系识别镜头并提取关键帧。对于每个关键帧,利用具有不同半径和像素值邻域关系的 WLD 检测局部区域信息,从而获得多尺度下的强度增强关键帧。将这些多尺度 WLD 关键帧合并后,利用形态学运算计算水平梯度。随后对结果进行二值化,并基于几何属性消除假阳性。最后,采用连通分量分析和形态学膨胀操作来确定有助于文本定位的文本区域。在公开可用的标准 Hua、Horizontal-1 和 Horizontal-2 视频数据集上的实验结果表明,该方法能够准确检测和定位视频中各种尺寸、字体和颜色的文本。
引用
@article{arxiv.1504.03810,
title = {Text Localization in Video Using Multiscale Weber's Local Descriptor},
author = {B. H. Shekar and Smitha M. L.},
journal= {arXiv preprint arXiv:1504.03810},
year = {2016}
}
备注
IEEE SPICES, 2015