中文

对实体对齐最优方法的批判性评估

计算与语言 2021-05-27 v2 机器学习

摘要

本工作中,我们对知识图谱实体对齐任务中的两种最优(SotA)方法进行了广泛调研。为此,我们首先仔细审视基准测试过程并识别出若干缺陷,这些缺陷使得原作所报告结果并不总是具有可比性。此外,我们怀疑社区中存在直接在测试集上优化超参数的普遍做法,降低了所报告性能的信息价值。因而我们选取了具有代表性的基准数据集样本并描述其属性。我们也考察了实体表示的不同初始化方式,因其为模型性能的决定性因素。进而,我们采用共享的训练/验证/测试划分以构建公平评估环境,在其中于所有数据集上评估所有方法。我们的评估得出若干有趣发现:虽多数情况下 SotA 方法优于基线,但当数据集含噪声时(多数实际应用均如此)它们存在困难;且通过消融研究我们发现,SotA 方法中常起关键作用的特性与此前设想不同。代码见 https://github.com/mberr/ea-sota-comparison。

关键词

引用

@article{arxiv.2010.16314,
  title  = {A Critical Assessment of State-of-the-Art in Entity Alignment},
  author = {Max Berrendorf and Ludwig Wacker and Evgeniy Faerman},
  journal= {arXiv preprint arXiv:2010.16314},
  year   = {2021}
}

备注

updated acknowledgement and fixed typo