中文

专利短语到短语语义匹配数据集

计算与语言 2022-08-03 v1 人工智能 机器学习

摘要

有许多用于语义文本相似度的通用基准数据集,但其中没有一个是专注于专利和科学出版物中的技术概念的。本工作旨在通过提出一个新的由人工评分的上下文短语到短语匹配数据集来填补这一空白。整个数据集包含接近 50,00050,000 个已评分的短语对,每个都带有一个 CPC(合作专利分类)类作为上下文。本文描述了该数据集以及一些基线模型。

关键词

引用

@article{arxiv.2208.01171,
  title  = {Patents Phrase to Phrase Semantic Matching Dataset},
  author = {Grigor Aslanyan and Ian Wetherbee},
  journal= {arXiv preprint arXiv:2208.01171},
  year   = {2022}
}

备注

Presented at the SIGIR PatentSemTech 2022 Workshop. The dataset can be accessed at https://www.kaggle.com/datasets/google/google-patent-phrase-similarity-dataset