中文

引导知识图谱链接预测的最优嵌入负采样生成方法

机器学习 2025-04-07 v1 计算与语言 信息检索

摘要

知识图谱嵌入(KGE)模型对知识图谱的结构信息进行编码以进行链接预测。有效训练这些模型需要能够高精度地区分正负样本。尽管先前研究表明,提高负样本质量可显著提升模型准确性,但确定高质量负样本仍是一个具有挑战性的问题。本文从理论上研究了负样本导致最优 KG 嵌入的条件,并识别了有效负样本分布的充分条件。基于这一理论基础,我们提出了一种 novel 框架——\textbf{E}mbedding \textbf{MU}tation (\textsc{EMU}),该框架\emph{生成}满足上述条件的负样本,不同于传统方法专注于\emph{识别}训练数据中具有挑战性的负样本。重要的是,\textsc{EMU}的简单性确保了与现有 KGE 模型和负采样方法的无缝集成。为评估其效能,我们在多个数据集上进行了全面实验。结果一致显示,\textsc{EMU}在各种 KGE 模型和负采样方法上都能显著提升链接预测性能。值得注意的是,\textsc{EMU}所实现的性能提升,可与嵌入维度扩大五倍的效果相当。该方法的实现及实验在 https://github.com/nec-research/EMU-KG 上提供。

关键词

引用

@article{arxiv.2504.03327,
  title  = {Optimal Embedding Guided Negative Sample Generation for Knowledge Graph Link Prediction},
  author = {Makoto Takamoto and Daniel Oñoro-Rubio and Wiem Ben Rim and Takashi Maruyama and Bhushan Kotnis},
  journal= {arXiv preprint arXiv:2504.03327},
  year   = {2025}
}

备注

11 pages, 6 figures, 15 Tables, accepted and to be published in TMLR