基于自监督学习的专利表征学习
计算与语言
2025-11-17 v1 机器学习
摘要
本文提出一种简单而有效的对比学习框架,通过利用同一文档内部的多重视图来学习专利嵌入。我们首先识别了 SimCSE 式 dropout 数据增强的一个专利特定的失效模式:其产生的嵌入过于均匀,导致语义一致性丧失。为此,我们提出了基于章节的数据增强方法,其中专利的不同章节(如摘要、权利要求、背景)作为互补视图使用。这种设计引入了自然的语义和结构多样性,缓解了过度分布问题,使嵌入更好地保留全局结构和局部连续性。在大规模基准测试中,我们的完全自监督方法在先前研究检索和分类任务中,与引用和 IPC 监督的基线方法相当或优于,同时避免了依赖脆弱或不完整注释的依赖。我们的分析进一步显示,不同章节对不同任务具有专门化——权利要求和摘要有助于检索,而背景章节有助于分类——凸显了利用专利内在话语结构进行表征学习的价值。这些结果凸显了利用文档内部视图进行可扩展且通用专利理解的重要性。
引用
@article{arxiv.2511.10657,
title = {Patent Representation Learning via Self-supervision},
author = {You Zuo and Kim Gerdes and Eric Villemonte de La Clergerie and Benoît Sagot},
journal= {arXiv preprint arXiv:2511.10657},
year = {2025}
}