多源大图上的激励兼容帕累托对齐
机器学习
2021-12-07 v1 计算机科学与博弈论
机器学习
摘要
本文关注于在多源大规模数据上学习有效的实体匹配模型。针对实际应用,我们放宽了数据源之间共享数据分布/空间或实体身份的典型假设,提出了松弛多源大规模实体匹配(RMLE)问题。该问题的挑战包括:1)如何对齐源间大规模实体以共享信息;2)如何缓解联合学习多源数据时的负迁移。更糟糕的是,一个实际问题是两个挑战相互纠缠。具体而言,错误的对齐可能加剧负迁移;而为一个源缓解负迁移可能导致其他源的表示学习不佳,进而降低对齐精度。为处理这一纠缠挑战,我们指出关键在于基于帕累托前沿优化优先优化信息共享,通过表明信息共享显著影响刻画负迁移下界的帕累托前沿。据此,我们提出激励兼容帕累托对齐(ICPA)方法,先基于帕累托前沿优化跨源对齐,再在优化后的对齐上约束缓解负迁移。该机制使每个源可基于其真实偏好学习,而无需担心恶化其他源的表示。具体而言,帕累托前沿优化鼓励最小化负迁移下界,从而优化是否对齐及对齐哪些。我们在四个大规模数据集上提供了全面的实证评估结果以证明 ICPA 的有效性和优越性。某搜索广告平台的在线 A/B 测试结果也证明了 ICPA 在生产环境中的有效性。
引用
@article{arxiv.2112.02792,
title = {Incentive Compatible Pareto Alignment for Multi-Source Large Graphs},
author = {Jian Liang and Fangrui Lv and Di Liu and Zehui Dai and Xu Tian and Shuang Li and Fei Wang and Han Li},
journal= {arXiv preprint arXiv:2112.02792},
year = {2021}
}