OmniTrack:视频中物体、文本与标识的实时检测与跟踪
计算机视觉与模式识别
2019-10-15 v1 图像与视频处理
摘要
视频中通用物体(如人、动物或汽车)、文本和标识的自动检测与跟踪对许多视频理解任务至关重要,且通常要求实时处理。我们提出OmniTrack,一种能够实时自动检测与跟踪物体、文本以及品牌标识的高效且鲁棒算法。它将在深度学习基础上强大的物体检测器(YoloV3)与高质量光流方法结合。基于YoloV3 C++参考实现,我们做了一些将描述的重要性能优化。将介绍用于文本与标识联合检测器的训练过程主要步骤。然后我们将描述由预处理、特征计算、预测、匹配与更新阶段组成的OmniTrack算法。若干性能优化也在此实现,如异步执行物体检测与光流计算。实验表明,所提算法在配备Quadro RTX 5000 GPU的PC上对标准清晰度()视频实时运行。
引用
@article{arxiv.1910.06017,
title = {OmniTrack: Real-time detection and tracking of objects, text and logos in video},
author = {Hannes Fassold and Ridouane Ghermi},
journal= {arXiv preprint arXiv:1910.06017},
year = {2019}
}
备注
accepted for IEEE ISM Conference, 2019