恶意幽默还是幽默:面向显性与隐性有害幽默的多模态、多语言基准
计算与语言
2026-03-20 v2 人工智能
摘要
黑色幽默常依赖细微的文化细微差别和隐含线索,需通过情境推理来解读,这给现有静态基准测试带来了安全挑战。为此,我们引入了一个用于检测和理解有害及冒犯性幽默的新型多模态、多语言基准。我们手动精选的数据集包含 3000 条文本和 6000 张图片(英文和阿拉伯语),以及 1200 条视频,涵盖英文、阿拉伯语及语言无关(通用)语境。不同于标准毒性数据集,我们实施严格的标注指南:区分安全幽默与有害幽默,后者进一步分为显性(overt)和隐性(covert)类别,以探究深层推理。我们系统评估了当前主流的开源和闭源模型在所有模态上的表现。我们的发现表明,闭源模型在性能上显著优于开源模型,英文和阿拉伯语之间的性能差异亦显著,这凸显了构建文化基础、认知感知安全对齐的关键性。警告:本文包含可能具有冒犯性、有害性或偏见性的示例数据。
引用
@article{arxiv.2603.17759,
title = {Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor},
author = {Ahmed Sharshar and Hosam Elgendy and Saad El Dine Ahmed and Yasser Rohaim and Yuxia Wang},
journal= {arXiv preprint arXiv:2603.17759},
year = {2026}
}