EventNet:用于视频复杂事件检测的大规模结构化概念库
计算机视觉与模式识别
2015-08-18 v2
摘要
事件特定概念是为感兴趣的事件设计的语义概念,可用作视频中复杂事件的中层表示。现有方法仅关注为少量预定义事件定义事件特定概念,无法处理新颖的未见事件。这促使我们构建一个大规模事件特定概念库,尽可能覆盖尽可能多的真实世界事件及其概念。具体而言,我们选择 WikiHow,一个包含大量关于人类日常生活事件的操作指南文章的在线论坛。我们执行从粗到细的事件发现过程,从 WikiHow 文章中发现 500 个事件。然后我们使用每个事件名称作为查询搜索 YouTube,并从返回视频的标签中发现事件特定概念。经过自动过滤过程,我们最终得到 95,321 个视频和 4,490 个概念。我们在 95,321 个视频上针对 500 个事件训练了一个卷积神经网络(Convolutional Neural Network, CNN)模型,并使用该模型从视频内容中提取深度学习特征。利用学习到的深度学习特征,我们训练了 4,490 个二值支持向量机(SVM)分类器作为事件特定概念库。这些概念和事件进一步被组织在由 WikiHow 定义的层次结构中,所得概念库称为 EventNet。最后,EventNet 概念库被用于生成基于事件的视频的概念表示。据我们所知,EventNet 代表了第一个将事件及其概念组织成语义结构的视频事件本体。它为事件检索和浏览提供了巨大潜力。在无可用的训练样本的零样本事件检索任务上的大量实验表明,EventNet 概念库持续且显著优于最先进水平(例如使用 CNN 训练的 20K ImageNet 概念),优势幅度高达 207%。
引用
@article{arxiv.1506.02328,
title = {EventNet: A Large Scale Structured Concept Library for Complex Event Detection in Video},
author = {Guangnan Ye and Yitong Li and Hongliang Xu and Dong Liu and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1506.02328},
year = {2015}
}