CantonesNLU:面向粤语自然语言理解的基准测试
计算与语言
2025-10-24 v1
摘要
尽管粤语拥有数以百万计的使用者,却因政策因素和文字书面语的差异导致资源匮乏。为弥补粤语评估框架的稀缺,本文引入CantonesNLU——一个针对粤语自然语言理解(NLU)的基准测试。该新基准测试涵盖七个任务,涵盖语法和语义,包括词义消歧、语言可接受性判断、语言检测、自然语言推理、情感分析、词性标注和依存句法分析。除基准测试外,我们还提供了模型基线性能:一个无粤语训练数据的普通话模型、两个通过在粤语文本上持续微调普通话模型获得的粤语适配模型,以及一个从零训练的单语粤语模型。结果表明,粤语适配模型总体性能最佳,而单语模型在语法任务上表现更好。普通话模型在某些情境下仍具竞争力,表明在粤语数据稀缺的情境下,直接迁移可能已足够。我们发布了所有数据集、代码和模型权重,以推动粤语NLP领域的后续研究。
引用
@article{arxiv.2510.20670,
title = {\textsc{CantoNLU}: A benchmark for Cantonese natural language understanding},
author = {Junghyun Min and York Hay Ng and Sophia Chan and Helena Shunhua Zhao and En-Shiun Annie Lee},
journal= {arXiv preprint arXiv:2510.20670},
year = {2025}
}
备注
13 pages, 1 figure