专利嵌入基准测试:22种模型在检索、分类和聚类中的多任务评估
信息检索
2026-05-27 v2 人工智能
摘要
关于从事者使用的专利嵌入涉及两个问题:(i)一种微调配方是否适用于所有下游应用?(ii)在一个专利领域上的微调是否足以用于其他领域的下游应用?通过在113,148份WIPO专利(46,069条引用查询)上,对22个预训练嵌入模型(参数规模从22M到12B)进行三项任务——信息检索、分类和聚类——的评估,以及在外部DAPFAM数据集上的评估,我们发现两项结果对目前的常识提出了质疑。(i)最佳微调配方取决于下游任务:交叉切片对齐配方(R3)为检索性能带来最大提升(+7.1% nDCG@10),而组合信号配方(R4)更适合分类(+7.1 F1)和聚类(+10.9 V-measure);匹配数据控制确认数据集大小差异并非 contributing factor。(ii)单领域微调会损害跨领域信息检索:在DAPFAM语料库上,对8个模型-配方组合中的5个进行跨域检索时,单领域微调显著降低了性能,强大的零样本模型受到最严重影响。虽然同一家族内的规模扩展是一致的(Qwen3 0.6B->4B->8B;Llama-Nemotron 1B->8B),但跨家族规模扩展不稳定;12B KaLM-Gemma3在TAC检索性能排名第8,紧随前缀修改之后。标题+摘要+权利书是最常用的文本视图,所有模型都存在55-65%的IN和OUT-of-domain性能差距,无法通过混合BM25-稠密融合来缓解。代码和评估框架已公开。
引用
@article{arxiv.2605.24297,
title = {Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering},
author = {Amirhossein Yousefiramandi and Ciaran Cooney},
journal= {arXiv preprint arXiv:2605.24297},
year = {2026}
}
备注
31 pages, 21 figures