VideoScoop:面向非传统领域的视频分析通用框架
计算机视觉与模式识别
2025-12-02 v1 数据库
摘要
自动理解视频内容对于 Civic Monitoring(CM)、一般监控(SL)、辅助生活(AL) 等多个应用至关重要。数十年的图像和视频分析(IVA)研究推动了内容提取任务(如目标识别和跟踪),但识别有意义的活动或情境(如两个目标靠近)仍然困难,内容提取 alone 无法实现。当前的视频情境分析(VSA)依赖人工操作或为特定视频类型/情境设计的定制算法,这些算法不具通用性,需为每个新情境或新领域的视频开发新算法/软件。本报告提出通用 VSA 框架,克服上述局限性。通过先使用最先进的视频内容提取技术提取视频内容,并采用扩展关系模型(R++)和图模型两种替代方案进行表示。采用 R++ 时,提取的内容可作为数据流,实现通过提出的视频分析连续查询语言进行持续查询处理;图模型则支持检测使用关系模型难以或无法检测的情境。现有图算法和新开发的算法支持广泛的情境检测。为实现领域无关性,识别跨领域的原始情境变体并表示为参数化模板。我们在来自 AL、CM 和 SL 三个领域的多个情境上进行大量实验,评估了该方法在这些领域异构视频数据集上的准确性、效率和鲁棒性。
引用
@article{arxiv.2512.01769,
title = {VideoScoop: A Non-Traditional Domain-Independent Framework For Video Analysis},
author = {Hafsa Billah},
journal= {arXiv preprint arXiv:2512.01769},
year = {2025}
}
备注
This is a report submitted as part of PhD proposal defense of Hafsa Billah