KurdSTS:库尔德语语义文本相似度基准
计算与语言
2025-12-01 v2 人工智能
摘要
语义文本相似度(STS)衡量两个文本之间意义的重叠程度,支撑着众多 NLP 任务。虽然高资源语言已有丰富资源,但低资源语言如库尔德语仍不受关注。我们提出,据称首个库尔德语 STS 数据集:10,000 句子对,涵盖正式和非正式语境,每对句子均标注了相似度。我们对 Sentence-BERT、多语言 BERT 等强大基线进行基准测试,取得具竞争力的结果,同时突显了由于库尔德语形态学、正字法变体和代码混合而产生的挑战。该数据集和基线建立了可复现的评估套件,为未来在库尔德语语义和低资源 NLP 领域的研究提供了强大的起点。
引用
@article{arxiv.2510.02336,
title = {KurdSTS: The Kurdish Semantic Textual Similarity},
author = {Abdulhady Abas Abdullah and Hadi Veisi and Hussein M. Al},
journal= {arXiv preprint arXiv:2510.02336},
year = {2025}
}