中文

用于专利表示学习的异构依赖图引导注意力

计算与语言 2026-05-28 v2

摘要

预训练语言模型通过将权利要求编码为扁平的 token 序列来推进专利分类与检索,却忽略了权利要求之间的依赖层级。将这种层级结构纳入自注意力机制带来两个挑战。首先,权利要求依赖涉及可靠性各异的关系类型:不加区分地对待它们会允许嘈杂的技术关系破坏更干净的法律引用信号。其次,当依赖图定义在权利要求级别时,Transformer 模型会失效,因为它们在 token 级别运行;广播权利要求级别的邻接关系会稀释不相关 token 对之间的结构信息。一种新颖的专利异构注意力图编码器(PHAGE)解决了这些挑战。为了处理异构依赖,PHAGE 构建了一个类型化图,将法律引用与技术关系区分为不同的边类型。为了弥合层级差距,PHAGE 引入了具有可学习关系感知偏置的连通性掩码,将权利要求级别的拓扑投影到 token 级别的注意力中。PHAGE 学习双粒度对比目标,以将表示与专利间分类法和专利内拓扑对齐。实验表明,PHAGE 在专利分类、检索和聚类方面优于领域自适应和引用感知基线。PHAGE 揭示了专利内权利要求拓扑比专利间结构捕获了更强的归纳偏置。

关键词

引用

@article{arxiv.2605.10073,
  title  = {Heterogeneous Dependency Graph-Guided Attentionfor Patent Representation Learning},
  author = {Yongmin Yoo and Qiongkai Xu and Zhangkai Wu and Longbing Cao},
  journal= {arXiv preprint arXiv:2605.10073},
  year   = {2026}
}