用于停止视频中文本识别的下一组合结果快速近似建模
计算机视觉与模式识别
2020-08-07 v1
摘要
在本文中,我们考虑文本字段视频流识别过程的停止任务,其中每帧被独立识别且个体结果被组合在一起。视频流识别停止问题在计算机视觉中是一个研究不足的课题,但其对于构建高性能视频识别系统的相关性是明确的。首先,我们描述了一种基于下一组合结果建模的、对此过程进行最优停止的现有方法。然后,我们描述了允许我们构建优化计算方案从而获得计算复杂度降低的方法的近似与假设。这些方法在文档文本字段识别与视频中任意文本识别任务上进行了评估。实验比较表明,所引入的近似在达成的组合结果精度方面未削弱停止方法的质量,同时大幅减少了做出停止决策所需的时间。结果对两个文本识别任务均一致。
引用
@article{arxiv.2008.02566,
title = {Fast Approximate Modelling of the Next Combination Result for Stopping the Text Recognition in a Video},
author = {Konstantin Bulatov and Nadezhda Fedotova and Vladimir V. Arlazarov},
journal= {arXiv preprint arXiv:2008.02566},
year = {2020}
}
备注
8 pages, 6 figures, 2 tables