PatentBERT:基于预训练 BERT 模型微调的专利分类
计算与语言
2019-07-02 v2 机器学习
机器学习
摘要
本文关注微调预训练 BERT 模型并将其应用于专利分类。当应用于超过两百万篇专利的大型数据集时,我们的方法优于使用带词嵌入的 CNN 的现有最优方法。此外,我们仅关注专利文档中的专利权利要求部分而不涉及其他部分。我们的贡献包括:(1) 一种基于预训练 BERT 模型及微调、用于专利分类的新最优方法;(2) 一个 CPC 子类级别、带有可供未来研究者使用的 SQL 语句的大型数据集 USPTO-3M;(3) 表明仅专利权利要求即足以完成分类任务,这与传统认知相反。
引用
@article{arxiv.1906.02124,
title = {PatentBERT: Patent Classification with Fine-Tuning a pre-trained BERT Model},
author = {Jieh-Sheng Lee and Jieh Hsiang},
journal= {arXiv preprint arXiv:1906.02124},
year = {2019}
}