中文

SeLeRoSa:句子级罗马尼亚语讽刺检测数据集

计算与语言 2025-10-16 v2

摘要

讽刺、反讽和挖苦是通常用于表达幽默和批评而非欺骗的技巧;然而,它们有时会被误认为是事实报道,类似于假新闻。这些技巧可以在更细粒度的层面上应用,从而允许将讽刺性信息纳入新闻文章中。在本文中,我们引入了首个用于新闻文章的罗马尼亚语讽刺检测的句子级数据集,称为 SeLeRoSa。该数据集包含 13,873 个手动标注的句子,涵盖多个领域,包括社会问题、IT、科学和电影。随着大型语言模型 (LLM) 在自然语言处理文献中的兴起和近期进展,LLM 已展现出在零样本设置下处理各种任务的增强能力。我们在零样本和微调设置下评估了多个基于 LLM 的基线模型,以及基于 Transformer 的基线模型。我们的发现揭示了这些模型在句子级讽刺检测任务中的当前局限性,为新的研究方向铺平了道路。

关键词

引用

@article{arxiv.2509.00893,
  title  = {SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset},
  author = {Răzvan-Alexandru Smădu and Andreea Iuga and Dumitru-Clementin Cercel and Florin Pop},
  journal= {arXiv preprint arXiv:2509.00893},
  year   = {2025}
}

备注

9 pages, 2 Figures