基于二值描述符的中层视频表示:以色情内容检测为例
计算机视觉与模式识别
2016-11-14 v1
摘要
随着互联网上不当内容(如色情内容)日益增多,对此类材料进行检测和过滤的需求应运而生。其原因在于,此类内容在某些环境(如学校和工作场所)或对某些受众(如儿童)通常是禁止的。近年来,许多工作主要集中于基于视觉内容,特别是肤色检测,来识别色情图像和视频。尽管这些方法提供了良好的结果,但它们通常存在假阳性率高的缺点,因为并非所有具有大面积皮肤暴露的图像都必然是色情图像,例如穿着泳装的人或与体育相关的图像。基于局部特征和词袋模型(BoW)的方法已成功应用于色情内容检测领域的视觉识别任务。尽管现有方法提供了有前景的结果,但它们使用的局部特征描述符需要较高的计算处理时间,并产生高维向量。在这项工作中,我们提出了一种基于局部二值特征提取和 BossaNova 图像表示的色情检测方法,BossaNova 是一种能更丰富地保留视觉信息的 BoW 模型扩展。此外,我们提出了两种基于中层表示组合的视频描述方法,即 BossaNova 视频描述符(BNVD)和 BoW 视频描述符(BoW-VD)。所提出的技术很有前景,在 Pornography 数据集上达到了 92.40% 的准确率,从而将分类误差较当前最先进的局部特征方法降低了 16%。
引用
@article{arxiv.1605.03804,
title = {A Mid-level Video Representation based on Binary Descriptors: A Case Study for Pornography Detection},
author = {Carlos Caetano and Sandra Avila and William Robson Schwartz and Silvio Jamil F. Guimarães and Arnaldo de A. Araújo},
journal= {arXiv preprint arXiv:1605.03804},
year = {2016}
}
备注
Manuscript accepted at Elsevier Neurocomputing