HateSieve: 用于检测和分割多模态表情包中仇恨内容的对比学习框架
人工智能
2025-05-01 v2 计算与语言
多媒体
社会与信息网络
摘要
随着大多模态模型(LMMs)的兴起及其在生成和解释复杂内容中的广泛应用,传播有偏见和有害表情包的风险仍然显著。目前的安全措施通常无法检测到"混淆表情包"中微妙整合的仇恨内容。为了解决这个问题,我们引入了HateSieve,一个旨在增强表情包中仇恨元素检测和分割的新框架。HateSieve包含一个新颖的对比表情包生成器,用于创建语义配对的表情包,一个定制的三元组数据集用于对比学习,以及一个图像-文本对齐模块,用于产生上下文感知的嵌入以实现准确的表情包分割。在仇恨表情包数据集上的实证实验表明,HateSieve不仅以更少的可训练参数超越了现有LMMs的性能,还提供了一个精确识别和隔离仇恨内容的鲁棒机制。注意:包含学术讨论中的仇恨言论内容,请读者自行判断。
引用
@article{arxiv.2408.05794,
title = {HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes},
author = {Xuanyu Su and Yansong Li and Diana Inkpen and Nathalie Japkowicz},
journal= {arXiv preprint arXiv:2408.05794},
year = {2025}
}
备注
Accepted at NAACL 2025 Findings; camera-ready version