中文

面向研究论文基于方面相似性的专用文档嵌入

信息检索 2022-03-29 v1 计算与语言

摘要

文档嵌入与相似性度量是基于内容的推荐系统的基石,其中文档通常表示为单一通用嵌入。然而,基于单向量表示计算的相似性仅提供文档相似性的一种视角,忽略了使两篇文档相似的是哪些方面。为克服该局限,基于方面的相似性度量已通过文档分割或成对多类文档分类得以开发。分割会损害文档连贯性,而成对分类方法在大规模语料上扩展性差。本文将基于方面的相似性视为方面特定嵌入空间中的经典向量相似性问题。我们将文档不表示为单一通用嵌入,而是表示为多个专用嵌入。我们的方法避免了文档分割,且相对于语料大小呈线性扩展。在实证研究中,我们使用包含 157,606 篇研究论文的 Papers with Code 语料,并将各研究论文的任务、方法与数据集视为其方面。我们在研究论文推荐背景下比较并分析了三种通用文档嵌入、六种专用文档嵌入以及一个成对分类基线。作为通用文档嵌入,我们考虑 FastText、SciBERT 和 SPECTER。为计算专用文档嵌入,我们比较了受 retrofitting、fine-tuning 和 Siamese 网络启发的三种替代方法。在我们的实验中,Siamese SciBERT 取得了最高分数。额外分析表明通用文档嵌入对各研究论文的数据集方面存在隐式偏向,而对方法方面存在隐式偏离。我们的方面文档嵌入方法通过使隐式偏向显式化,缓解了由其引发的潜在风险。

关键词

引用

@article{arxiv.2203.14541,
  title  = {Specialized Document Embeddings for Aspect-based Similarity of Research Papers},
  author = {Malte Ostendorff and Till Blume and Terry Ruas and Bela Gipp and Georg Rehm},
  journal= {arXiv preprint arXiv:2203.14541},
  year   = {2022}
}

备注

Accepted for publication at JCDL 2022