SiNFluD:创建和评估Sindhi语言讽刺语言数据集
计算与语言
2026-05-12 v2 人工智能
摘要
本文介绍了 SiNFluD,即用于 Sindhi 语言讽刺语言分类的新型基准数据集。我们首先从various blogs、社交媒体平台和文学来源收集原始文本,然后准备语料进行标注。两个母语标注者使用 Doccano 文本标注工具进行标注,实现了0.81的注释间一致性。随后我们采用 5 折交叉验证和 10 折交叉验证建立基准结果。最后,我们评估了 mBERT、XLM-RoBERTa、XLM-RoBERTa-XL 模型以及用于句子转换器的 few-shot 微调的 SetFit。其中,预训练的 XLM-RoBERTa-XL 实现了最佳性能。
引用
@article{arxiv.2605.01323,
title = {SiNFluD: Creating and Evaluating Figurative Language Dataset for Sindhi},
author = {Wazir Ali and Adeeb Noor and Saifullah Tumrani},
journal= {arXiv preprint arXiv:2605.01323},
year = {2026}
}