MuSaG:德语多模态讽刺数据集 with 完整模式标注
计算与语言
2026-03-05 v2 人工智能
摘要
讽刺是一种复杂的修辞语言形式,意图含义与字面含义相矛盾。其在社交媒体和流行文化中的普遍存在,为自然语言理解、情感分析和内容 moderation 带来持续挑战。随着多模态大型语言模型的出现,讽刺检测已超越文本,需整合音频和视觉线索。我们提出MuSaG,这是第一个德语多模态讽刺检测数据集,包含来自德国电视节目的33分钟的手动挑选和人工标注语句。每个实例提供对齐的文本、音频和视频模态,由人工标注,支持单模态和多模态setting下的评估。我们对九个开源和商业模型(涵盖文本、音频、视觉和多模态架构)进行基准测试,并与人类标注进行比较。结果显示,人类在对话场景中高度依赖音频,而模型在文本方面表现最佳。这凸显了当前多模态模型的差距,激励利用MuSaG开发更适用于真实场景的模型。我们公开发布MuSaG,以支持未来在多模态讽刺检测和人机模型对齐方面的研究。
引用
@article{arxiv.2510.24178,
title = {MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations},
author = {Aaron Scott and Maike Züfle and Jan Niehues},
journal= {arXiv preprint arXiv:2510.24178},
year = {2026}
}