中文

他加禄语分词、词性标注与依存句法分析的零样本与少样本方法基准评测

计算与语言 2023-01-09 v2

摘要

任何书面语言文本的语法分析通常涉及若干基本处理任务,如分词、形态标注和依存句法分析。对于拥有大型数据集的语言,当前最优系统在这些任务上可达到高准确率,但对于几乎无标注数据的语言则结果较差。为解决他加禄语的这一难题,我们研究了在缺乏依存标注的他加禄语数据情况下,利用替代语言资源来创建特定任务模型。我们还探索了在仅有少量标注他加禄语数据时,使用词嵌入和数据增强来提升性能。我们表明,与当前最优的有监督基线相比,这些零样本和少样本方法在他加禄语文本的领域内和跨领域语法分析上均带来了显著提升。

关键词

引用

@article{arxiv.2208.01814,
  title  = {Benchmarking zero-shot and few-shot approaches for tokenization, tagging, and dependency parsing of Tagalog text},
  author = {Angelina Aquino and Franz de Leon},
  journal= {arXiv preprint arXiv:2208.01814},
  year   = {2023}
}

备注

Presented at PACLIC 2022. 12 pages, 3 figures, 4 tables