用于专利分类的大型语言模型:优势、权衡与长尾效应
计算工程、金融与科学
2026-02-02 v1
摘要
将专利分类到 CPC 代码中支撑着大规模的技术变革分析,但由于其层次化、多标签和高度不平衡的结构,这一任务仍然具有挑战性。虽然生成式 AI 之前的基于编码器的监督模型已成为大规模专利分类的事实标准,但大型语言模型(LLM)的最新进展引发了关于它们是否能提供互补能力的问题,特别是对于罕见或代表性不足的技术类别。在这项工作中,我们在一个高度不平衡的基准数据集(USPTO 70k)上,对基于编码器的分类器(BERT、SciBERT 和 PatentSBERTa)和开源权重 LLM 进行了系统比较。我们在零样本、少样本和检索增强提示下评估了 LLM,并进一步评估了最佳性能模型的参数高效微调。我们的结果表明,基于编码器的模型在频繁的 CPC 子类上取得了强劲的结果,从而实现了更高的整体性能,但在罕见子类上表现不佳。相比之下,LLM 在不频繁的子类上取得了相对更高的性能,这些子类通常与早期、跨领域或制度化程度较弱的技术相关,尤其是在更高的层次级别上。这些发现表明,基于编码器的方法和基于 LLM 的方法在专利分类中扮演着互补的角色。我们还量化了推理时间和能耗,表明基于编码器的模型比 LLM 高效多达三个数量级。总的来说,我们的结果为负责任的专利计量学和技术映射提供了信息,并激发了混合分类方法,即在计算和环境约束下,结合编码器的效率与 LLM 的长尾覆盖能力。
引用
@article{arxiv.2601.23200,
title = {Large Language Models for Patent Classification: Strengths, Trade-offs, and the Long Tail Effect},
author = {Lorenzo Emer and Marco Lippi and Andrea Mina and Andrea Vandin},
journal= {arXiv preprint arXiv:2601.23200},
year = {2026}
}
备注
44 pages, 8 figures