中文

GRDD:一个希腊方言自然语言处理数据集

计算与语言 2025-10-15 v5

摘要

在本文中,我们提出了一个用于计算研究若干现代希腊方言的数据集。它由来自现代希腊四种方言(克里特方言、本都方言、北希腊方言和塞浦路斯希腊方言)的原始文本数据组成。该数据集规模相当大,尽管存在不平衡,并首次尝试为现代希腊方言创建此类大规模方言资源。然后我们使用该数据集进行方言识别。我们尝试了传统机器学习算法以及简单的深度学习架构。结果显示在该任务上性能非常好,潜在地揭示了所讨论的方言具有足够明显的特征,使得即使是简单的机器学习模型也能在该任务上表现良好。对性能最佳的算法进行了错误分析,表明在许多情况下错误是由于数据集清理不足造成的。

关键词

引用

@article{arxiv.2308.00802,
  title  = {GRDD: A Dataset for Greek Dialectal NLP},
  author = {Stergios Chatzikyriakidis and Chatrine Qwaider and Ilias Kolokousis and Christina Koula and Dimitris Papadakis and Efthymia Sakellariou},
  journal= {arXiv preprint arXiv:2308.00802},
  year   = {2025}
}