面向 GNN 实体解析的紧致表达层次
机器学习
2026-03-31 v1 人工智能
数据结构与算法
摘要
实体解析——识别指指同一真实实体的 database 记录——自然地在连接实体节点与其属性值的节点双图上进行建模。对 message-passing 神经网络 (MPNN) 应用所有可用的扩展(逆消息传递、端口编号、ego ID)会产生不必要的开销,因为不同的实体解析任务具有根本不同的复杂度。对于给定的匹配准则,什么是能够 provable 工作的最便宜 MPNN 架构?我们通过对 typed entity-attribute 图的四个定理分离理论来回答这一问题。我们引入 co-reference 谓词 (两个相同类型的实体共享至少 个属性值)以及 循环谓词 用于具有实体-实体边的情形。对于每个谓词,我们证明了紧致界限——构建在没有必需适应的 MPNN 无法区分的图对,并展示在所有输入上计算该谓词的显式最小深度 MPNN。核心发现是检测任何共享属性与检测多个共享属性之间存在尖锐的复杂度差距。前者是纯本地的,仅需两层逆消息传递即可实现。后者需要跨属性身份关联——验证同一实体是否出现在目标的多个属性中——这是一个根本非本地的要求,需要 ego ID 和四层,即使在无环双图上亦是如此。类似的必要性也适用于循环检测。这些结果 collectively 产生一种最小架构原则:实践者可以选择最便宜且足够的适应性集合,确保没有更简单的架构可工作。计算验证确认了每个预测。
引用
@article{arxiv.2603.27154,
title = {A Tight Expressivity Hierarchy for GNN-Based Entity Resolution in Master Data Management},
author = {Ashwin Ganesan},
journal= {arXiv preprint arXiv:2603.27154},
year = {2026}
}