基于多模态 CNN 的不当视频场景审查工具
多媒体
2019-11-12 v1 信息检索
摘要
由于视频分享平台及其存储服务的广泛使用,互联网上此类媒体的数量已变得极为庞大。如此规模的数据使得难以控制这些视频文件中可能包含的内容类型。关于视频内容的主要担忧之一在于其是否含有不当主题,例如裸体、暴力或其他潜在令人不适的内容。除了判断一个视频是否恰当或不恰当之外,识别其中哪些部分包含此类内容也很重要,以保留在简单宽泛分析中被丢弃的片段。在本工作中,我们提出了一种基于卷积神经网络(CNNs)的多模态(使用音频与图像特征)架构,用于检测视频文件中的不当场景。在视频文件分类任务中,我们的模型在恰当类与不恰当类上分别取得了 98.95% 和 98.94% 的 F1-score。我们还提出了一款可自动审查视频文件中不当片段的审查工具。
引用
@article{arxiv.1911.03974,
title = {A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes},
author = {Pedro V. A. de Freitas and Paulo R. C. Mendes and Gabriel N. P. dos Santos and Antonio José G. Busson and Álan Livio Guedes and Sérgio Colcher and Ruy Luiz Milidiú},
journal= {arXiv preprint arXiv:1911.03974},
year = {2019}
}