中文

以 HuSpaCy 推进匈牙利语文本处理:高效且准确的 NLP 流水线

计算与语言 2023-08-25 v1 人工智能 机器学习

摘要

本文提出一套面向匈牙利语的工业级文本处理模型,在平衡资源效率与准确度的同时达到接近最先进(SOTA)的性能。模型已在 spaCy 框架中实现,并对 HuSpaCy 工具包架构做了若干改进以对其扩展。相较于现有匈牙利语 NLP 工具,我们的所有流水线均具备全部基础文本处理步骤,包括分词、句边界检测、词性标注、形态学特征标注、词形还原、依存句法分析与命名实体识别,且具有高准确度与高吞吐率。我们详尽评估了所提改进,将流水线与最先进工具比较,并展示了新模型在所有文本预处理步骤中的竞争性能。所有实验均可复现,且流水线在宽松许可下免费可用。

关键词

引用

@article{arxiv.2308.12635,
  title  = {Advancing Hungarian Text Processing with HuSpaCy: Efficient and Accurate NLP Pipelines},
  author = {György Orosz and Gergő Szabó and Péter Berkecz and Zsolt Szántó and Richárd Farkas},
  journal= {arXiv preprint arXiv:2308.12635},
  year   = {2023}
}

备注

Submitted to TSD 2023 Conference