中文

SiNFluD:创建和评估Sindhi语言讽刺语言数据集

计算与语言 2026-05-12 v2 人工智能

摘要

本文介绍了 SiNFluD,即用于 Sindhi 语言讽刺语言分类的新型基准数据集。我们首先从various blogs、社交媒体平台和文学来源收集原始文本,然后准备语料进行标注。两个母语标注者使用 Doccano 文本标注工具进行标注,实现了0.81的注释间一致性。随后我们采用 5 折交叉验证和 10 折交叉验证建立基准结果。最后,我们评估了 mBERT、XLM-RoBERTa、XLM-RoBERTa-XL 模型以及用于句子转换器的 few-shot 微调的 SetFit。其中,预训练的 XLM-RoBERTa-XL 实现了最佳性能。

关键词

引用

@article{arxiv.2605.01323,
  title  = {SiNFluD: Creating and Evaluating Figurative Language Dataset for Sindhi},
  author = {Wazir Ali and Adeeb Noor and Saifullah Tumrani},
  journal= {arXiv preprint arXiv:2605.01323},
  year   = {2026}
}