中文

第二语言韩语通用依存树库 v1.2:聚焦数据增强与注释方案细化

计算与语言 2025-03-20 v1

摘要

我们扩展了第二语言(L2)韩语通用依存(UD)树库,新增 5,454 句手动注释的句子。也修订了注释指南,以更好地与 UD 框架保持一致。使用这个增强后的树库,我们对三个韩语语言模型进行微调,并在域内和域外 L2-韩语数据集上对其性能进行评估。结果显示,微调显著改善了它们在各种指标上的性能,从而凸显了使用针对 L2 数据而微调的第一语言为基础的通用语言模型进行 L2 数据形态学和句法分析的重要性。

关键词

引用

@article{arxiv.2503.14718,
  title  = {Second language Korean Universal Dependency treebank v1.2: Focus on data augmentation and annotation scheme refinement},
  author = {Hakyung Sung and Gyu-Ho Shin},
  journal= {arXiv preprint arXiv:2503.14718},
  year   = {2025}
}