专利相似性嵌入模型的比较分析
计算与语言
2024-03-26 v1 信息检索
机器学习
摘要
本文对基于文本的专利相似性领域做出了两项贡献。首先,它比较了不同类型的专利特定预训练嵌入模型在专利相似性计算任务上的性能,即静态词嵌入(如 word2vec 和 doc2vec 模型)和上下文词嵌入(如基于 transformers 的模型)。其次,它专门比较了具有不同训练阶段的 Sentence Transformers(SBERT)架构在专利相似性任务上的性能。为评估模型性能,我们使用了关于专利抵触的信息,这是一种两个或多个属于不同专利申请的专利权利要求被专利审查员证明为重叠的现象。因此,我们将这些抵触案例用作两个专利之间最大相似性的代理,将其视为真实基准来评估不同嵌入模型的性能。我们的结果表明,首先,Patent SBERT-adapt-ub,即本研究中提出的预训练 Sentence Transformer 架构的领域自适应版本,在专利相似性方面优于当前最先进水平。其次,它们表明,在某些情况下,当在大量数据上训练时,大型静态模型的性能仍然可与上下文模型相媲美;因此,我们认为上下文嵌入性能的优越性可能并非与实际架构相关,而是与训练阶段的执行方式相关。
引用
@article{arxiv.2403.16630,
title = {A comparative analysis of embedding models for patent similarity},
author = {Grazia Sveva Ascione and Valerio Sterzi},
journal= {arXiv preprint arXiv:2403.16630},
year = {2024}
}