基于多模态层次交叉注意力模型的在线视频漫画恶作剧内容标注
计算机视觉与模式识别
2024-06-13 v1 计算与语言
摘要
我们解决了检测在线媒体中可疑内容的挑战,具体指漫画恶作剧这一子类别。这种内容类型将暴力、成人内容或讽刺与幽默结合,难以检测。采用多模态方法至关重要,以捕捉漫画恶作剧内容所蕴含的细微细节。为解决此问题,我们提出了一种用于漫画恶作剧检测的新型端到端多模态系统。作为本工作的一部分,我们发布了一个针对目标任务的新型数据集,包含三个模态:视频、文本(视频字幕和字幕)和音频。我们还设计了一种层次交叉注意力模型(HICCAP),以捕捉这些模态之间的复杂关系。结果表明,所提出的方法在漫画恶作剧检测及其类型分类方面显著优于稳健基线和SOTA模型。这凸显了该系统赋予用户做出关于他们选择看到的在线内容的明智决策的潜力。此外,我们在UCF101、HMDB51和XD-Violence数据集上进行了实验,与其他SOTA方法进行了比较,展示了我们提出模型在各种情景下的卓越性能。
引用
@article{arxiv.2406.07841,
title = {Labeling Comic Mischief Content in Online Videos with a Multimodal Hierarchical-Cross-Attention Model},
author = {Elaheh Baharlouei and Mahsa Shafaei and Yigeng Zhang and Hugo Jair Escalante and Thamar Solorio},
journal= {arXiv preprint arXiv:2406.07841},
year = {2024}
}