中文

连接点:利用检索到的短语图推断专利短语相似度

计算与语言 2024-03-26 v1

摘要

我们研究了专利短语相似度推断任务,该任务衡量两个专利短语之间的语义相似度。由于专利文件使用法律性和高度技术性的语言,现有的利用局部上下文信息的语义文本相似度方法在推断专利短语相似度方面表现不佳。为了解决这个问题,我们引入了一种图增强方法来放大专利短语的全局上下文信息。对于每个专利短语,我们构建一个短语图,将其链接到其焦点专利以及一系列引用这些焦点专利或被这些焦点专利引用的专利。然后,通过将其局部上下文嵌入与其在短语图中的全局嵌入相结合,推导出增强的短语嵌入。我们进一步提出了一种自监督学习目标,该目标利用检索到的拓扑结构,以端到端的方式细化上下文嵌入和图参数。来自一个独特专利短语相似度数据集的实验结果表明,我们的方法显著增强了专利短语的表示,从而以自监督的方式在相似度推断方面取得了显著改进。在有监督的设置中也观察到了实质性的改进,这突显了利用检索到的短语图增强的潜在好处。

关键词

引用

@article{arxiv.2403.16265,
  title  = {Connecting the Dots: Inferring Patent Phrase Similarity with Retrieved Phrase Graphs},
  author = {Zhuoyi Peng and Yi Yang},
  journal= {arXiv preprint arXiv:2403.16265},
  year   = {2024}
}

备注

Findings of NAACL 2024