中文

PatentScore:LLM生成专利权利要求的多维评估

计算与语言 2025-09-17 v2 人工智能

摘要

专利权利要求、医疗记录和技术报告等高风险文本结构复杂,要求高度的可靠性和精确性。虽然大型语言模型(LLM)最近被应用于在高风险领域自动生成此类文本,但可靠地评估这些输出仍然是一项重大挑战。传统的自然语言生成(NLG)指标对一般文档有效,但无法捕捉评估复杂高风险文档所必需的结构和法律特征。为了填补这一空白,我们提出了PatentScore,一个专门为最复杂和最严格的领域之一——专利权利要求设计的多维评估框架。PatentScore集成了权利要求要素的层次分解、基于法律和技术标准的验证模式,以及跨结构、语义和法律维度的评分。在由400个Claim1组成的数据集上的实验中,PatentScore与专家注释的相关性最高(r=0.819r = 0.819),显著优于广泛使用的NLG指标。这项工作为评估LLM生成的专利权利要求建立了新标准,为专利生成和验证研究提供了坚实基础。

关键词

引用

@article{arxiv.2505.19345,
  title  = {PatentScore: Multi-dimensional Evaluation of LLM-Generated Patent Claims},
  author = {Yongmin Yoo and Qiongkai Xu and Longbing Cao},
  journal= {arXiv preprint arXiv:2505.19345},
  year   = {2025}
}