基于 Transformer 的文章编码器在引文推荐任务上的大规模评估
信息检索
2022-09-13 v1 计算与语言
摘要
近年来提出的基于 Transformer 的文章编码器(TAE)旨在为相互关联的科学文章生成相似的向量表示,并在科学文章推荐的基准数据集上展现出强劲性能。然而,现有基准数据集主要聚焦于单一领域,且在某些情况下包含候选池较小的简单负样本。在此类基准上评估表示可能会掩盖 TAE 在候选池包含数千篇文章的设置中的真实性能。在这项工作中,我们在具有更具挑战性候选池的大规模基准上评估 TAE。我们将 TAE 与词法检索基线模型 BM25 在引文推荐任务上进行比较,该任务要求模型为给定输入文章生成一份用于引用的推荐列表。我们发现 BM25 仍与最先进的神经检索器极具竞争力,考虑到 TAE 在小型基准上的强劲表现,这一发现令人惊讶。作为对现有基准局限性的补救,我们提出了一个新的用于评估科学文章表示的基准数据集:多领域引文推荐数据集(MDCR),其涵盖不同科学领域并包含具有挑战性的候选池。
引用
@article{arxiv.2209.05452,
title = {Large-scale Evaluation of Transformer-based Article Encoders on the Task of Citation Recommendation},
author = {Zoran Medić and Jan Šnajder},
journal= {arXiv preprint arXiv:2209.05452},
year = {2022}
}
备注
Accepted to the Third Workshop on Scholarly Document Processing @ COLING 2022