BERT-CNN:一种基于预训练语言模型的层次化专利分类器
计算与语言
2019-11-15 v1 机器学习
摘要
自动分类是将文本文档自动分配到预定义类别的过程。准确的自动专利分类器对于专利发明人和专利审查员在知识产权保护、专利管理和专利信息检索方面至关重要。我们提出了 BERT-CNN,一种基于预训练语言模型的层次化专利分类器,其训练数据来自中国国家信息中心收集的国家专利申请文档。实验结果表明,BERT-CNN 达到了 84.3% 的准确率,远优于所对比的两个基线方法——卷积神经网络(Convolutional Neural Networks)和循环神经网络(Recurrent Neural Networks)。我们未将模型应用于国际专利分类的第三和第四层次——“子类”和“组”。注意力机制(Attention Mechanism)的可视化显示,BERT-CNN 在词汇与语义表示方面取得了新的 SOTA 结果。本文证明了 BERT-CNN 在自动专利分类领域的实用性与有效性。
引用
@article{arxiv.1911.06241,
title = {BERT-CNN: a Hierarchical Patent Classifier Based on a Pre-Trained Language Model},
author = {Xiaolei Lu and Bin Ni},
journal= {arXiv preprint arXiv:1911.06241},
year = {2019}
}
备注
in Chinese