从非对称视角以混合模态重新思考多模态内容审核
计算机视觉与模式识别
2023-12-15 v3 计算机与社会
摘要
随着社交媒体上越来越多内容本质上是多模态的,对多模态内容审核(CM)的需求迅速增长。现有的单模态 CM 系统可能漏掉跨模态的有害内容(例如表情包或视频),从而导致严重后果。在本文中,我们提出一种新颖的 CM 模型,非对称混合模态审核(AM3),以面向多模态与单模态 CM 任务。具体而言,为解决视觉与语言之间语义的非对称性,AM3 具有一种新颖的非对称融合架构,其设计不仅融合两模态中的共性知识,也利用各模态中的独有信息。与先前工作聚焦于将两模态表示至相似特征空间却忽视多模态与单模态所传达信息之间的内在差异(模态间非对称性)不同,我们提出一种新颖的跨模态对比损失来学习仅出现在多模态中的独有知识。这至关重要,因为某些有害意图可能仅通过两模态的交集传达。通过大量实验,我们表明 AM3 在多模态与单模态 CM 基准上均优于所有现有的最先进方法。
引用
@article{arxiv.2305.10547,
title = {Rethinking Multimodal Content Moderation from an Asymmetric Angle with Mixed-modality},
author = {Jialin Yuan and Ye Yu and Gaurav Mittal and Matthew Hall and Sandra Sajeev and Mei Chen},
journal= {arXiv preprint arXiv:2305.10547},
year = {2023}
}
备注
Accepted at WACV 2024