社交媒体新闻帖子中多模态语义不一致检测
计算机视觉与模式识别
2021-05-28 v1
摘要
随着计算机生成内容与 deepfakes 的稳步改进,多媒体取证的语义方法将变得更为重要。本文引入一种新颖的分类架构,用于识别社交媒体新闻帖子中视频外观与文本标题之间的语义不一致。我们开发了一个多模态融合框架,通过基于标题的文本分析、自动音频转写、语义视频分析、目标检测、命名实体一致性与人脸验证的集成方法来识别社交媒体帖子中视频与标题的不匹配。为训练和测试我们的方法,我们整理了一个包含 4,000 条真实世界 Facebook 新闻帖子的新视频数据集用于分析。我们的多模态方法在标题与外观的随机不匹配上达到了 60.5% 的分类准确率,而单模态模型的准确率低于 50%。进一步的消融研究证实了跨模态融合对于正确识别语义不一致的必要性。
引用
@article{arxiv.2105.12855,
title = {Multi-Modal Semantic Inconsistency Detection in Social Media News Posts},
author = {Scott McCrae and Kehan Wang and Avideh Zakhor},
journal= {arXiv preprint arXiv:2105.12855},
year = {2021}
}