联合利用特征与类别关系的正则化深度神经网络视频分类
计算机视觉与模式识别
2018-02-23 v2 多媒体
摘要
本文中,我们研究了根据高层语义(如特定人类动作或复杂事件的存在性)对视频进行分类这一具有挑战性的问题。尽管近年来已投入大量努力,现有工作大多使用简单的融合策略组合多个视频特征,并忽视了类间语义关系的利用。本文提出一种新颖的统一框架,联合利用特征关系与类别关系以提升分类性能。具体而言,这两类关系通过在深度神经网络(DNN)的学习过程中严格施加正则化来进行估计和利用。这种正则化DNN(rDNN)可通过基于GPU的实现高效实现,且训练成本可接受。通过赋予DNN更好地利用特征与类别关系的能力,所提出的rDNN更适于建模视频语义。通过广泛的实验评估,我们表明rDNN优于若干最先进(SOTA)方法。在知名的好莱坞2(Hollywood2)和哥伦比亚消费视频(Columbia Consumer Video)基准上,我们取得了极具竞争力的结果:在平均精度均值(mean average precision)上分别为66.9\%和73.5\%。此外,为充分评估我们的rDNN并促进大规模视频分类的未来研究,我们收集并发布了一个称为FCVID的新基准数据集,其包含91,223个互联网视频和239个手动标注的类别。
引用
@article{arxiv.1502.07209,
title = {Exploiting Feature and Class Relationships in Video Categorization with Regularized Deep Neural Networks},
author = {Yu-Gang Jiang and Zuxuan Wu and Jun Wang and Xiangyang Xue and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1502.07209},
year = {2018}
}
备注
Please cite the officially published IEEE TPAMI version if you find this work helpful