中文

知识图谱嵌入中负采样损失函数的统一平滑方法解释

计算与语言 2024-07-08 v1 机器学习

摘要

知识图谱(KG)是知识密集型任务在自然语言处理中的基础资源。由于手动创建 KG 的限制,KG 完成(KGC)在通过 KG 嵌入(KGE)对其链接进行评分以自动完成 KG 方面发挥着重要作用。为了处理大量实体,KGE 依赖负采样(NS)损失,该损失通过采样来降低计算成本。鉴于每个链接的出现频率最多为 1,稀疏性是这类问题中不可避免且至关重要的因素。NS 损失亦是如此。作为解决方案,KGE 中的 NS 损失依赖类似自对抗负采样(SANS)和抽样的平滑方法。然而,由于缺乏理论理解,尚不确定哪种平滑方法适合此目的。本文为 KGE 中 NS 损失的平滑方法提供了理论解释,并诱导出一种新的 NS 损失——三元组自适应负采样(TANS),该方法可以涵盖传统平滑方法的特征。在 FB15k-237、WN18RR 和 YAGO3-10 数据集及其更稀疏的子集上对 TransE、DistMult、ComplEx、RotatE、HAKE 和 HousE 进行实验,结果表明我们的解释是合理的,并且通过 TANS 实现了性能提升。

关键词

引用

@article{arxiv.2407.04251,
  title  = {Unified Interpretation of Smoothing Methods for Negative Sampling Loss Functions in Knowledge Graph Embedding},
  author = {Xincan Feng and Hidetaka Kamigaito and Katsuhiko Hayashi and Taro Watanabe},
  journal= {arXiv preprint arXiv:2407.04251},
  year   = {2024}
}

备注

9 pages, 4 figures, 2 tables; accepted to workshop RepL4NLP held in conjunction with ACL 2024