针对生成专利文本的现有技术检索与重排序
计算与语言
2021-07-20 v2
摘要
诸如 GPT-2 之类的生成模型近期已展现出令人印象深刻的成果。我们旨在解决的一个基本问题是:生成的文本从何而来?本工作是我们通过现有技术检索回答该问题的初步尝试。现有技术检索的目的是在 GPT-2 的训练数据中找到最相似的先前文本。我们采取重排序方法并将其应用于专利领域。具体而言,我们使用来自 USPTO 的专利数据从头预训练 GPT-2 模型。现有技术检索的输入是由 GPT-2 模型生成的专利文本。我们还从头预训练了 BERT 模型用于将专利文本转换为嵌入。重排序的步骤为:(1)通过词袋排序方法(BM25)在 GPT-2 的训练数据中检索最相似文本,(2)将文本格式的检索结果转换为 BERT 嵌入,以及(3)基于其与 GPT-2 生成的专利文本的相似度对 BERT 嵌入排序以提供最终结果。本工作的实验表明,此种重排序优于仅使用嵌入排序。然而,我们喜忧参半的结果也表明,计算长文本跨度间的语义相似度仍具挑战性。据我们所知,本工作是首个实现重排序系统以基于 GPT 模型输出回溯识别最相似输入的。
引用
@article{arxiv.2009.09132,
title = {Prior Art Search and Reranking for Generated Patent Text},
author = {Jieh-Sheng Lee and Jieh Hsiang},
journal= {arXiv preprint arXiv:2009.09132},
year = {2021}
}
备注
7 pages, 3 figures, 1 table