中文

Deceptive Humor:用于桥接虚构声明与幽默内容的合成多语言基准数据集

计算与语言 2025-06-23 v3

摘要

在线话语不断演变,误information 日益采用幽默语调以规避检测并获得更大的传播效应。本工作提出了 Deceptive Humor 作为一种新兴研究方向,强调虚构叙事包裹在幽默之中会变得更难检测且更可能被传播。为支持这一领域的研究,我们提供了 Deceptive Humor 数据集(DHD),该数据集由使用 ChatGPT-4o 模型从虚构声明派生出的幽默评论组成。每条数据都标注了幽默程度(从 1 表示微妙讽刺到 3 表示明显讽刺)并分类为五种幽默类型:黑色幽默、讽刺、社会评论、文字游戏和荒诞。该数据集涵盖英文、泰卢固语、印地语、卡纳达语、泰米尔语及其代码混合形式,是 multilingual 分析的宝贵资源。DHD 提供了结构化基础,帮助理解幽默如何作为信息扩散的载体,微妙地增强其传播范围和影响力。我们建立了强大的基线,以鼓励进一步的研究和模型开发在这一新兴领域。

关键词

引用

@article{arxiv.2503.16031,
  title  = {Deceptive Humor: A Synthetic Multilingual Benchmark Dataset for Bridging Fabricated Claims with Humorous Content},
  author = {Sai Kartheek Reddy Kasu and Shankar Biradar and Sunil Saumya},
  journal= {arXiv preprint arXiv:2503.16031},
  year   = {2025}
}

备注

7 Pages, 2 figures, 7 tables