Pap2Pat:基于专利-论文配对的面向长文本专利生成基准
计算与语言
2025-06-19 v3 人工智能
摘要
处理长篇复杂技术文本是大型语言模型(LLM)面临的挑战,尚未充分展现其在支持高昂且耗时的专利草拟等进程中的潜力。在专利文档中,描述部分占比超过90%。然而,其自动生成仍属少数研究课题。在专利撰写过程中,专利代理人通常会收到发明报告(IR),但这些报告往往是机密的,导致研究受限。经常以发表论文作为IR。我们利用这种二元关系构建了PAP2PAT,一个开放且真实可靠的专利草拟基准,包含1.8千组专利-论文配对,描述同一发明。为解决复杂长文档的专利生成任务,我们提出了基于块的轮廓引导生成方法,以研究论文作为发明规格。我们通过PAP2PAT进行了广泛评估,并进行了人类案例研究,表明LLM能够有效利用论文中的信息,但仍在提供必要细节方面存在不足。微调可产生更符合专利语言风格的文本,但也会导致更严重的幻觉现象。我们发布了数据和代码 https://github.com/boschresearch/Pap2Pat。
引用
@article{arxiv.2410.07009,
title = {Pap2Pat: Benchmarking Outline-Guided Long-Text Patent Generation with Patent-Paper Pairs},
author = {Valentin Knappich and Simon Razniewski and Anna Hätty and Annemarie Friedrich},
journal= {arXiv preprint arXiv:2410.07009},
year = {2025}
}
备注
ACL 2025 Findings