中文

MDIT-Bench:评估大型多模态模型中的双重隐性毒性

计算与语言 2025-05-26 v1 人工智能

摘要

大型多模态模型(LMM)的广泛使用引发了关于模型毒性的担忧。然而,当前研究主要关注显性毒性,而对一些更具隐性的毒性——如偏见和歧视——关注较少。为弥补这一局限,我们引入了一种更微妙的毒性类型,称为双重隐性毒性,并提出了一种新型毒性基准测试——MDIT-Bench:多模态双重隐性毒性基准。具体而言,我们首先使用提出的多阶段人机交互上下文生成方法创建了具有双重隐性毒性的MDIT数据集。基于该数据集,我们构建了MDIT-Bench,一个用于评估模型对双重隐性毒性敏感性的基准,包含317,638个问题,覆盖12个类别、23个子类别和780个主题。MDIT-Bench包含三个难度级别,我们提出了一种度量方法来衡量模型在各难度级别之间表现出的毒性差距。在实验中,我们对13个知名LMM进行了MDIT-Bench测试,结果表明这些LMM无法有效处理双重隐性毒性。模型在困难级别上的性能显著下降,揭示了这些LMM仍然包含大量隐藏但可激活的毒性。数据可在 https://github.com/nuo1nuo/MDIT-Bench 获取。

关键词

引用

@article{arxiv.2505.17144,
  title  = {MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models},
  author = {Bohan Jin and Shuhan Qi and Kehai Chen and Xinyi Guo and Xuan Wang},
  journal= {arXiv preprint arXiv:2505.17144},
  year   = {2025}
}

备注

Findings of ACL 2025