中文

DeHate:一种基于 Stable Diffusion 的多模态图像仇恨言论缓解方法

计算机视觉与模式识别 2025-10-13 v2 计算与语言

摘要

有害在线内容的增加不仅扭曲了公共话语,也对维护健康的数字环境构成了重大挑战。为了应对这一问题,我们引入了一个专门为识别数字内容中的仇恨而构建的多模态数据集。我们方法的核心是创新性地应用了带水印、稳定性增强的 stable diffusion 技术并结合数字注意力分析模块 (DAAM)。这种结合有助于精确定位图像中的仇恨元素,从而生成详细的仇恨注意力图,利用这些图对图像中的这些区域进行模糊处理,从而移除图像中的仇恨部分。我们发布该数据集作为 dehate 共享任务的一部分。本文还描述了该共享任务的细节。此外,我们提出了 DeHater,一种专为多模态去仇恨任务设计的视觉-语言模型。我们的方法在基于文本提示的 AI 驱动图像仇恨检测领域树立了新标准,有助于在社交媒体中开发更具伦理性的 AI 应用。

关键词

引用

@article{arxiv.2509.21787,
  title  = {DeHate: A Stable Diffusion-based Multimodal Approach to Mitigate Hate Speech in Images},
  author = {Dwip Dalal and Gautam Vashishtha and Anku Rani and Aishwarya Reganti and Parth Patwa and Mohd Sarique and Chandan Gupta and Keshav Nath and Viswanatha Reddy and Vinija Jain and Aman Chadha and Amitava Das and Amit Sheth and Asif Ekbal},
  journal= {arXiv preprint arXiv:2509.21787},
  year   = {2025}
}

备注

Defactify 3 workshop at AAAI 2024