将实体对齐速度提升 10 倍以上:带归一化难样本挖掘的双重注意力匹配网络
人工智能
2021-03-30 v1
摘要
在多源知识图谱(KGs)中寻找等价实体是知识图谱整合的关键步骤,也称为实体对齐(EA)。然而,大多数现有 EA 方法效率低下且可扩展性差。近期一篇综述指出,其中某些方法甚至需要数天来处理一个含 200,000 个节点(DWY100K)的数据集。我们认为过于复杂的图编码器与低效的负采样策略是两大主因。本文提出一种新型 KG 编码器——双重注意力匹配网络(Dual-AMN),它不仅能巧妙建模图内与跨图信息,还大幅降低计算复杂度。此外,我们提出归一化难样本挖掘损失(Normalized Hard Sample Mining Loss)以平滑选择难负样本并减少损失偏移。在广泛使用公开数据集上的实验结果表明,我们的方法实现了高准确率与高效率。在 DWY100K 上,我们方法的整个运行过程可在 1,100 秒内完成,至少比先前工作快 10 倍。我们的方法在所有数据集上的表现也均优于先前工作,其中 Hits@1 与 MRR 提升了 6% 至 13%。
引用
@article{arxiv.2103.15452,
title = {Boosting the Speed of Entity Alignment 10*: Dual Attention Matching Network with Normalized Hard Sample Mining},
author = {Xin Mao and Wenting Wang and Yuanbin Wu and Man Lan},
journal= {arXiv preprint arXiv:2103.15452},
year = {2021}
}
备注
12 pages; Accepted by TheWebConf(WWW) 2021