利用统计高效迁移学习扩展多源实体解析
数据库
2012-08-10 v1 机器学习
摘要
我们考虑了一个严重且此前未被探索的挑战,该挑战几乎阻碍了所有将实体解析 (ER) 扩展至多数据源的方法:即为每对数据源的相似度评分进行监督学习而标注训练数据的成本过高。虽然已有大量文献描述了成对 ER 的几乎所有方面,但由于获取和存储在线来源数据的能力空前增强、由 ER 驱动的丰富搜索垂直领域等功能,以及每个来源噪声和缺失数据特征的独特性,这一新挑战如今应运而生。我们在真实和合成数据上表明,对于最先进技术而言,异构来源的现实意味着为了保持恒定的精确率/召回率,标注训练数据的数量必须随来源数量呈二次方增长。我们通过一种全新的迁移学习算法应对这一挑战,该算法所需的训练数据少得多(或者说在相同数据下可实现更高的准确率),并使用快速凸优化进行训练。我们方法背后的直觉是自适应地共享从一个评分问题中学到的结构,并将其应用于所有共享同一数据源的其他评分问题。我们证明,这种具有理论依据的方法不会产生额外的运行时间成本,同时能在标注成本仅随来源数量线性增加的情况下保持恒定的精确率/召回率。
引用
@article{arxiv.1208.1860,
title = {Scaling Multiple-Source Entity Resolution using Statistically Efficient Transfer Learning},
author = {Sahand Negahban and Benjamin I. P. Rubinstein and Jim Gemmell},
journal= {arXiv preprint arXiv:1208.1860},
year = {2012}
}
备注
Short version to appear in CIKM'2012; 10 pages, 7 figures