中文

小数据 regime 下基于神经网络的自动化专利图景化

计算与语言 2024-07-12 v1 人工智能 信息检索

摘要

专利图景化是识别特定技术领域内所有专利的过程,对评估知识产权背景的各个方面至关重要。传统方法构建专利图景化过程繁琐且昂贵,近年来专利申请活动的快速扩张推动了对高效且有效的自动化专利图景化方法的日益增长的需求。尤其关键在于,我们能够仅使用极少数量的标记样例即可构建专利图景化,因为为特定技术领域标记专利需要高度专业的知识(且成本高昂)。我们提出了一个自动化神经网络专利图景化系统,展示在困难样本上的显著性能提升('硬' 样本上的 F1 分数提升至 0.69,远超先前报告的系统的 0.6),训练数据显著减少(整体仅使用 24 个样本即可达到 0.75 的 F1 分数)。此外,在评估此类自动化图景化系统时,获取高质�数据是挑战;我们演示了将 Abood 和 Feltenberger(2018)的“seed/anti-seed”方法与主动学习结合,用于收集决策边界附近的困难标记样本的高质量训练数据生成程序。我们创建了一个新的 AI 专利标记数据集用于训练和测试。与先前工作类似,我们与多种基线系统进行比较,并发布代码和数据供他人继承使用。

关键词

引用

@article{arxiv.2407.08001,
  title  = {Automated Neural Patent Landscaping in the Small Data Regime},
  author = {Tisa Islam Erana and Mark A. Finlayson},
  journal= {arXiv preprint arXiv:2407.08001},
  year   = {2024}
}

备注

11 pages, 4 figures