中文

面向中文专利的精确分词研究

计算与语言 2016-12-01 v1

摘要

专利是政府授予发明者对其发明享有的财产权。一项发明是特定技术问题的解决方案。因此,专利通常包含高浓度的科技术语,这些术语在日常语言中很少出现。在当前可用的日常语言数据集上训练的中文分词模型表现不佳,因为它无法有效识别这些科技术语。本文描述了一种实用的中文专利分词方法,我们通过从一个包含 142 篇专利的人工分词语料库中提取特征,并辅以从中文树库中提取的信息,训练了一个基于字符的半监督序列标注模型。实验表明,我们模型的准确率在留出测试集上达到 95.08%(F1 分数),在开发集上达到 96.59%,相比之下,若模型仅在中文树库上训练,其在开发集上的 F1 分数为 91.48%。我们还实验了一些现有的领域自适应技术,结果表明目标领域数据量和所选特征会影响领域自适应技术的性能。

关键词

引用

@article{arxiv.1611.10038,
  title  = {Towards Accurate Word Segmentation for Chinese Patents},
  author = {Si Li and Nianwen Xue},
  journal= {arXiv preprint arXiv:1611.10038},
  year   = {2016}
}