ShieldVLM:通过深思熟虑的跨模态推理保护多模态隐式有害内容
多媒体
2025-05-21 v1 计算与语言
摘要
多模态文本-图像内容的有害检测正面临日益增长的挑战,尤其是当单一模态看似良性但组合后传递危险信息时。多模态隐式有害内容不仅以社交平台上的正式陈述形式出现,也会以可能引发有害对话的提示形式出现,这些提示会触发大型视觉语言模型(LVLMs)。尽管单模态文本或图像 moderation 已取得成功,但针对多模态内容,特别是多模态隐式有害性的检测仍属未充分探索的领域。为填补这一空白,本文全面构建了多模态隐式有害性分类体系(MMIT),并引入了 MMIT 数据集,包含 2100 条跨 7 种风险类别(31 个子类别)和 5 种典型跨模态关联模式的多模态陈述与提示。为推进多模态隐式有害性检测,我们构建了 ShieldVLM 模型,通过深思熟虑的跨模态推理识别多模态陈述、提示和对话中的隐式有害内容。实验表明,ShieldVLM 在检测显式和隐式有害内容方面优于现有强大基线。该模型和数据集将对外公开,以支持未来研究。警告:本文包含可能敏感的内容。
引用
@article{arxiv.2505.14035,
title = {ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs},
author = {Shiyao Cui and Qinglin Zhang and Xuan Ouyang and Renmiao Chen and Zhexin Zhang and Yida Lu and Hongning Wang and Han Qiu and Minlie Huang},
journal= {arXiv preprint arXiv:2505.14035},
year = {2025}
}