面向低资源语言的大规模语义数据集生成混合协议:土耳其语语义关系语料库
计算与语言
2026-01-21 v1 机器学习
摘要
我们提出一种用于低资源语言生成大规模语义关系数据集的混合方法, 通过土耳其语语义关系语料库进行验证。该方法集成三个阶段:(1) 使用FastText嵌入和层次聚类识别语义簇,(2) 使用Gemini 2.5-Flash进行自动语义关系分类,(3) 集成精选词典来源。最终数据集包含843,000个唯一的土耳其语语义配对,涵盖三种关系类型(同义词、反义词、同位从属词),规模是现有资源的10倍,成本仅为65美元。我们通过两个下游任务验证了数据集:嵌入模型实现90%的Top-1检索准确率,分类模型达到90%的F1-Macro分数。该可扩展协议解决了土耳其NLP领域的关键数据稀缺问题, 并演示了对其他低资源语言的适用性。我们公开发布了数据集和模型。
引用
@article{arxiv.2601.13253,
title = {A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus},
author = {Ebubekir Tosun and Mehmet Emin Buldur and Özay Ezerceli and Mahmoud ElHussieni},
journal= {arXiv preprint arXiv:2601.13253},
year = {2026}
}