PatentTransformer-2:利用结构元数据控制专利文本生成
计算与语言
2020-01-14 v1
摘要
PatentTransformer 是我们基于 Transformer 模型的专利文本生成的代号。我们的目标是“增强发明”。在第二版中,我们利用了专利中更多的结构元数据。除先前的独立权利要求外,结构元数据还包括专利标题、摘要和从属权利要求。元数据控制模型生成何种专利文本。此外,我们利用元数据之间的关系构建文本到文本的生成流,例如,从几个词到标题,标题到摘要,摘要到独立权利要求,以及独立权利要求到多个从属权利要求。由于关系是双向训练的,文本流可以逆向进行。我们发布了从头训练的 GPT-2 模型以及用于推理的代码,以便读者自行验证和生成专利文本。在生成质量方面,我们通过 ROUGE 和 Google Universal Sentence Encoder 对其进行度量。
引用
@article{arxiv.2001.03708,
title = {PatentTransformer-2: Controlling Patent Text Generation by Structural Metadata},
author = {Jieh-Sheng Lee and Jieh Hsiang},
journal= {arXiv preprint arXiv:2001.03708},
year = {2020}
}
备注
demo paper