中文

CinPatent:用于专利分类的数据集

计算与语言 2024-03-18 v3

摘要

专利分类是将每篇输入专利分配至若干代码(类别)的任务。因其高需求,已有若干数据集与方法被提出。然而,基线方法的系统性性能对比缺失以及部分数据集难以获取,为该任务留下了空白。为填补空白,我们引入使用 CPC 代码收集的英日两种新数据集。英文数据集包含 45,131 篇专利文档与 425 个标签,日文数据集包含 54,657 篇文档与 523 个标签。为便利后续研究,我们在两个数据集上对比了强多标签文本分类方法的性能。实验结果显示 AttentionXML 持续优于其他强基线。消融研究还从两方面展开:专利不同部分(标题、摘要、说明书与权利要求)的贡献,以及基线在不同训练数据划分下性能的表现。我们发布了两个新数据集与基线代码。

关键词

引用

@article{arxiv.2212.12192,
  title  = {CinPatent: Datasets for Patent Classification},
  author = {Minh-Tien Nguyen and Nhung Bui and Manh Tran-Tien and Linh Le and Huy-The Vu},
  journal= {arXiv preprint arXiv:2212.12192},
  year   = {2024}
}

备注

This paper describes an on-going work