中文

面向异构信息网络的预训练模型

人工智能 2021-05-19 v2 计算与语言 机器学习

摘要

在网络表示学习中,我们将异构信息网络表示为低维空间,以便于高效的搜索、分类和预测方案。先前的网络表示学习方法通常需要充足的任务特定标注数据来解决领域特定问题,训练好的模型通常无法迁移至域外数据集。我们提出一种自监督预训练与微调框架 PF-HIN,以捕获异构信息网络的特征。不同于传统网络表示学习模型需为每个下游任务和数据集从头整体重训,PF-HIN 只需微调模型及少量额外任务特定参数,从而提升模型效率与效果。预训练阶段,我们首先将给定节点的邻域转换为序列。PF-HIN 基于两个自监督任务预训练:掩码节点建模与相邻节点预测。我们采用深度双向 transformer 编码器训练模型,并利用因子化嵌入参数化与跨层参数共享来缩减参数量。微调阶段,我们选取四个基准下游任务:链接预测、相似度搜索、节点分类与节点聚类。在四个数据集上,PF-HIN 在每个任务上均一致且显著优于最先进的替代方法。

关键词

引用

@article{arxiv.2007.03184,
  title  = {Pre-Trained Models for Heterogeneous Information Networks},
  author = {Yang Fang and Xiang Zhao and Yifan Chen and Weidong Xiao and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2007.03184},
  year   = {2021}
}

备注

Submitted to TKDE