中文

基于欧洲专利数据集丰富专利权利要求生成

计算与语言 2025-05-20 v1

摘要

起草专利权利要求耗时、昂贵,且需要专业技能。因此,研究人员调查使用大型语言模型(LLM)帮助发明者编写权利要求。然而,现有工作主要依赖美国专利商标局(USPTO)的数据集。为拓展关于各种司法管辖、起草惯例和法律标准的研究范围,我们引入EPD(European Patent Dataset),即欧洲专利数据集。EPD提供丰富的文本数据和结构化元数据,以支持多项专利相关任务,包括权利要求生成。该数据集在三个关键方面丰富了该领域:(1)司法管辖多样性:来自不同机构的专利在法律和起草惯例上存在差异。EPD通过提供面向欧洲专利的基准,填补了关键空白,使评估更为全面。(2)质量提升:EPD提供高质量获批专利,具有最终且经法律批准的文本,而其他数据集则由未经审查或临时专利申请组成。实验表明,在EPD上微调的LLM在权利要求质量和跨域泛化方面显著优于在先前数据集上训练的LLM,甚至优于GPT-4o。(3)真实世界仿真:我们提出EPD的一个困难子集,以更好地反映权利要求生成的真实世界挑战。结果显示,所有测试的LLM在这些具挑战性的样本上表现大幅下降,这凸显了未来研究的必要性。

关键词

引用

@article{arxiv.2505.12568,
  title  = {Enriching Patent Claim Generation with European Patent Dataset},
  author = {Lekang Jiang and Chengzu Li and Stephan Goetz},
  journal= {arXiv preprint arXiv:2505.12568},
  year   = {2025}
}

备注

18 pages, 13 tables, 4 figures