中文

N-LTP:一个面向中文的开源神经语言技术平台

计算与语言 2021-09-24 v4

摘要

我们介绍了 \texttt{N-LTP},一个支持六项中文基础 NLP 任务的开源神经语言技术平台:{词法分析}(中文分词、词性标注和命名实体识别)、{句法分析}(依存句法分析)和 {语义分析}(语义依存分析和语义角色标注)。与现有最先进的工具包(如 \texttt{Stanza})为每个任务采用独立模型不同,\texttt{N-LTP} 通过使用共享预训练模型的多任务框架,具有捕获相关中文任务间共享知识的优势。此外,进一步引入了知识蒸馏方法 \cite{DBLP:journals/corr/abs-1907-04829},即由单任务模型教导多任务模型,以鼓励多任务模型超越其单任务教师。最后,我们提供了一系列易用的 API 和可视化工具,使用户更轻松、直观地使用和查看处理结果。据我们所知,这是首个支持六项中文 NLP 基础任务的工具包。源代码、文档和预训练模型可在 \url{https://github.com/HIT-SCIR/ltp} 获取。

关键词

引用

@article{arxiv.2009.11616,
  title  = {N-LTP: An Open-source Neural Language Technology Platform for Chinese},
  author = {Wanxiang Che and Yunlong Feng and Libo Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2009.11616},
  year   = {2021}
}

备注

Accepted to appear in EMNLP 2021 (Demo)