Stanza:面向多种人类语言的 Python 自然语言处理工具包
计算与语言
2020-04-24 v2
摘要
我们介绍 Stanza,一个支持 66 种人类语言的开源 Python 自然语言处理工具包。与现有广泛使用的工具包相比,Stanza 具有与语言无关的完全神经化文本分析流水线,包括分词、多词令牌展开、词形还原、词性与形态特征标注、依存句法分析和命名实体识别。我们在总计 112 个数据集上训练了 Stanza,包括 Universal Dependencies 树库及其他多语言语料库,并表明相同的神经架构能良好泛化,并在所有测试语言上取得有竞争力的性能。此外,Stanza 包含广泛使用的 Java Stanford CoreNLP 软件的原生 Python 接口,进一步将其功能扩展至共指消解与关系抽取等任务。66 种语言的源代码、文档与预训练模型可在 https://stanfordnlp.github.io/stanza 获取。
引用
@article{arxiv.2003.07082,
title = {Stanza: A Python Natural Language Processing Toolkit for Many Human Languages},
author = {Peng Qi and Yuhao Zhang and Yuhui Zhang and Jason Bolton and Christopher D. Manning},
journal= {arXiv preprint arXiv:2003.07082},
year = {2020}
}
备注
ACL2020 System Demonstration. First two authors contribute equally. Website: https://stanfordnlp.github.io/stanza