LatinCy:用于拉丁语 NLP 的合成训练流水线
计算与语言
2023-05-09 v1
摘要
本文介绍 LatinCy,一套训练好的通用拉丁语“核心”流水线,可与 spaCy 自然语言处理框架配合使用。这些模型在大量可用的拉丁语数据上训练,包括全部五个拉丁语 Universal Dependency 树库,这些树库已经过预处理以彼此兼容。其结果是一套在多项自然语言处理任务上表现良好的拉丁语通用模型(例如性能最佳的模型在词性标注上达到 97.41% 准确率、在词形还原上达到 94.66% 准确率、在形态标注上达到 92.76% 准确率)。本文描述了模型训练,包括其训练数据与参数设置,并展示了拥有可用 NLP 工作的 spaCy 模型对拉丁语研究者的优势。
引用
@article{arxiv.2305.04365,
title = {LatinCy: Synthetic Trained Pipelines for Latin NLP},
author = {Patrick J. Burns},
journal= {arXiv preprint arXiv:2305.04365},
year = {2023}
}
备注
10 pages, 1 table, 4 figures