fastHan:基于 BERT 的中文 NLP 多任务工具包
计算与语言
2021-06-01 v2
摘要
我们推出 fastHan,一个面向中文自然语言处理四项基础任务的开源工具包:中文分词(CWS)、词性(POS)标注、命名实体识别(NER)和依存句法分析。fastHan 的骨干是一个基于剪枝 BERT 的多任务模型,其使用 BERT 的前 8 层。我们还提供了一个由 8 层模型压缩得到的 4 层基础模型。该联合模型在四项任务的 13 个语料库上训练和评估,在依存句法分析和 NER 上取得接近最先进(SOTA)的性能,在 CWS 和 POS 上达到 SOTA 性能。此外,fastHan 的迁移能力也很强,在非训练语料库上表现远优于流行的分词工具。为更好满足实际应用需求,我们允许用户使用自有标注数据进一步微调 fastHan。除体积小、性能优外,fastHan 还易于使用。其作为 python 包实现,将用户与内部技术细节隔离,使用方便。该项目发布于 Github。
引用
@article{arxiv.2009.08633,
title = {fastHan: A BERT-based Multi-Task Toolkit for Chinese NLP},
author = {Zhichao Geng and Hang Yan and Xipeng Qiu and Xuanjing Huang},
journal= {arXiv preprint arXiv:2009.08633},
year = {2021}
}
备注
ACL2021 Demo Track