中文

RPT:通过预训练实现异构研究者数据上的可迁移模型

信息检索 2022-03-02 v2 数字图书馆 机器学习

摘要

随着学术引擎的发展,对海量研究者数据的挖掘和分析获取,例如合作者推荐和研究者检索,已变得不可或缺。这可以提高学术引擎的服务质量和智能化水平。现有的大多数研究者数据挖掘研究都专注于特定应用场景的单一任务,并学习一个任务特定的模型,该模型通常无法迁移到范围外的任务。预训练技术提供了一种通用且可共享的模型,以从海量无标签数据中捕获有价值的信息。该模型可以通过少量微调步骤完成多个下游任务。在本文中,我们提出了一个基于多任务自监督学习的研究者数据预训练模型,名为RPT。具体来说,我们将研究者数据划分为语义文档集和社区图。我们分别设计了分层Transformer和局部社区编码器,以从这两类数据中捕获信息。然后,我们提出了三个自监督学习目标来训练整个模型。最后,我们还提出了RPT的两种迁移模式,用于在不同场景下进行微调。我们进行了广泛的实验来评估RPT,在三个下游任务上的结果验证了预训练对于研究者数据挖掘的有效性。

关键词

引用

@article{arxiv.2110.07336,
  title  = {RPT: Toward Transferable Model on Heterogeneous Researcher Data via Pre-Training},
  author = {Ziyue Qiao and Yanjie Fu and Pengyang Wang and Meng Xiao and Zhiyuan Ning and Denghui Zhang and Yi Du and Yuanchun Zhou},
  journal= {arXiv preprint arXiv:2110.07336},
  year   = {2022}
}

备注

Accepted as regular paper by IEEE Transactions on Big Data