中文

通过跨度相关性度量专利权利要求生成

计算与语言 2019-12-03 v2

摘要

我们专利权利要求生成的目标是通过利用最新深度学习技术为发明人实现“增强发明”。我们设想在人工智能时代为发明人构建“自动补全”功能以构思更好的发明。为生成高质量的专利权利要求,一个基本问题是如何度量它。我们从权利要求跨度相关性的视角处理该问题。专利权利要求语言在 NLP 领域极少被探索。它独具特色且包含丰富的显式与隐式人类标注。本工作中,我们提出一种基于跨度的方法和一个通用框架来定量度量专利权利要求生成。为研究专利权利要求生成的有效性,我们定义了一种度量生成专利权利要求中两个连续跨度是否相关的指标。我们将此类相关性度量视为跨度对分类问题,遵循自然语言推理的概念。技术上,跨度对分类器通过微调预训练语言模型实现。专利权利要求生成通过微调另一预训练模型实现。具体地,我们微调一个预训练的 Google BERT 模型来度量由一个微调的 OpenAI GPT-2 模型生成的专利权利要求跨度。以此方式,我们复用了 NLP 领域两个最先进的预训练模型。我们的结果显示了微调预训练模型后跨度对分类器的有效性。它进一步验证了专利权利要求生成中跨度相关性的定量指标。特别地,我们发现由 BERT 度量的跨度相关性比率在 GPT-2 文本生成多样性变高时变得更低。

关键词

引用

@article{arxiv.1908.09591,
  title  = {Measuring Patent Claim Generation by Span Relevancy},
  author = {Jieh-Sheng Lee and Jieh Hsiang},
  journal= {arXiv preprint arXiv:1908.09591},
  year   = {2019}
}

备注

10 pages, 2 figures, 2 tables. To be published in the Proceedings of the Thirteenth International Workshop on Juris-informatics (JURISIN 2019), hosted by JSAI-isAI2019