中文

Yor-Sarc:面向低资源非洲语言讽刺检测的黄金标准数据集

计算与语言 2026-02-24 v1

摘要

讽刺检测对计算语义学提出了根本性挑战,要求模型解决字面意义与意图意义之间的差异。在标注数据集稀缺或根本不存在的低资源语言中,这一挑战被放大。我们提出了\textbf{Yor-Sarc},这是首个用于约鲁巴语(一种由超过5000万人使用的声调尼日尔-刚果语)讽刺检测的黄金标准数据集。该数据集包含436个实例,由三位来自不同方言背景的母语者使用专门为约鲁巴语讽刺设计的、考虑文化因素的标注协议进行标注。该协议融入了情境敏感的解释和社区知情指南,并附有对标注者间一致性的全面分析,以支持在其他非洲语言中的复制。达到了从“实质”到“几乎完美”的一致性(Fleiss' κ=0.7660\kappa = 0.7660;成对Cohen's κ=0.6732\kappa = 0.6732--0.87430.8743),其中83.3%的实例达成一致共识。一对标注者达到了几乎完美的一致性(κ=0.8743\kappa = 0.8743;原始一致性93.8%),超过了多项已报道的英语讽刺研究基准。其余16.7%的多数一致案例被保留为软标签,用于不确定性感知建模。Yor-Sarc\footnote{https://github.com/toheebadura/yor-sarc}有望促进面向低资源非洲语言的语义解释和文化信息丰富的自然语言处理研究。

关键词

引用

@article{arxiv.2602.18964,
  title  = {Yor-Sarc: A gold-standard dataset for sarcasm detection in a low-resource African language},
  author = {Toheeb Aduramomi Jimoh and Tabea De Wille and Nikola S. Nikolov},
  journal= {arXiv preprint arXiv:2602.18964},
  year   = {2026}
}