PatenTEB:面向专利文本嵌入的全面基准与模型族
计算与语言
2025-10-28 v1 人工智能
信息检索
摘要
专利文本嵌入使先前技术检索、技术景观和专利分析成为可能,但现有基准不充分捕捉专利特定挑战。我们引入 PatenTEB,一个包含 15 项任务的全面基准,涵盖检索、分类、释义和聚类,总计 206 万个样本。PatenTEB 采用领域分层划分、领域特定硬负挖掘,以及系统覆盖片段到文档不对称匹配场景(常被通用嵌入基准忽略)。我们通过多任务训练开发了 patembed 模型族,参数规模从 670 万到 3440 万不等,上下文长度最高可达 4096 token。外部验证显示其泛化能力突出:patembed-base 在 MTEB BigPatentClustering.v2 上达到 0.494 V-measure(超越上一最佳 0.445),而 patembed-large 在 DAPFAM 上达到 0.377 NDCG@100。系统化消融实验表明,尽管基准代价略有增加,多任务训练仍能提升外部泛化;领域预训练初始化在各任务族中均提供一致优势。所有资源将公开于 https://github.com/iliass-y/patenteb。
引用
@article{arxiv.2510.22264,
title = {PatenTEB: A Comprehensive Benchmark and Model Family for Patent Text Embedding},
author = {Iliass Ayaou and Denis Cavallucci},
journal= {arXiv preprint arXiv:2510.22264},
year = {2025}
}