利用视听融合增强儿童视频的多模态内容审核
计算机视觉与模式识别
2024-05-13 v1
摘要
由于面向儿童的视频内容创作的增加,视频托管平台需要稳健的内容审核方案。一个视觉上无害的视频可能包含不适合幼儿的音频内容,而这是单模态内容审核系统无法检测到的。面向儿童的热门视频托管平台(如 YouTube Kids)仍然发布包含不利于儿童健康行为与身体发育的音频内容的视频。对恶意视频的稳健分类除了视频特征外还需要音频表示。然而,最近的内容审核方法很少采用明确考虑非语音音频线索的多模态架构。为了解决这个问题,我们提出了一种对 CLIP(Contrastive Language-Image Pre-training)的有效适配,使其能够利用上下文音频线索来增强内容审核。我们整合了 1) 音频模态和 2) 提示学习,同时保持每种模态的主干模块冻结。我们在 MOB(Malicious or Benign)数据集的多模态版本上进行了监督和少样本设置下的实验。
引用
@article{arxiv.2405.06128,
title = {Enhanced Multimodal Content Moderation of Children's Videos using Audiovisual Fusion},
author = {Syed Hammad Ahmed and Muhammad Junaid Khan and Gita Sukthankar},
journal= {arXiv preprint arXiv:2405.06128},
year = {2024}
}
备注
8 pages, 3 figures, Accepted at The 37th International FLAIRS Conference