中文

用于多场景视频查询与摘要的共享语义空间发现

计算机视觉与模式识别 2016-11-17 v1

摘要

公共空间闭路电视(CCTV)安装数量的增长产生了对利用视频监控数据的自动化方法的需求,包括场景理解、查询、行为标注与摘要。为此,人们对监控场景理解与分析进行了广泛研究。然而,多数研究考虑单一场景或相邻场景组。不同但相关场景(例如许多布局相似的交通场景)之间的语义相似性通常被未用于改进任何自动化监控任务并减少人工负担。然而,由于以下原因,利用共性并共享任何有监督标注在不同场景间是具有挑战性的:某些场景完全不相关——因此它们之间的任何信息共享都是有害的;而其他场景可能仅共享一部分共同活动——因此只有当信息共享具有选择性时才有用。此外,应被共同建模并跨场景共享的语义相似活动在每个场景中可能具有截然不同的像素级外观。为解决这些问题,我们开发了一个用于分布式多场景全局理解的新框架,该框架根据场景解释彼此行为的能力对监控场景进行聚类;并进一步发现每个聚类内哪些活动子集是共享的而非场景特定的。我们展示了如何利用这种多场景的结构化表示来改进常见的监控任务,包括场景活动理解、跨场景按例查询、减少有监督标注要求的行为分类以及视频摘要。在每种情况下,我们均展示了我们的多场景模型如何改进一组标准单场景模型以及所有场景的扁平模型。

关键词

引用

@article{arxiv.1507.07458,
  title  = {Discovery of Shared Semantic Spaces for Multi-Scene Video Query and Summarization},
  author = {Xun Xu and Timothy Hospedales and Shaogang Gong},
  journal= {arXiv preprint arXiv:1507.07458},
  year   = {2016}
}

备注

Multi-Scene Traffic Behaviour Analysis ---- Accepted at IEEE Transactions on Circuits and Systems for Video Technology