跨数据集事件序列在稀疏或无公共出现情况下的链接
机器学习
2017-11-15 v1 信息检索
社会与信息网络
机器学习
摘要
具有实际意义的数据——如个人记录、交易日志和病史——是与特定源实体相关的事件顺序集合。近期研究试图跨数据集链接代表同一实体的序列,以进行更全面的统计分析和识别潜在的隐私泄露。然而,当前方法仍局限于其特定应用领域,且当不同数据集中的共指序列包含稀疏或无公共事件时(这在许多情况下频繁发生)会失效。为此,我们形式化了“序列链接”的一般问题,并描述了“LDA-Link”,一种即便共指事件序列完全无公共项也适用的通用解决方案。LDA-Link 构建于“Split-Document”模型之上,这是一种用于生成事件序列集合的新型混合隶属概率模型。它检测序列的潜在相似性,从而在共指序列共享稀疏或无事件重叠时实现鲁棒性。我们将 LDA-Link 应用于社交媒体档案对齐场景,其中用户跨平台无公共发帖,并与最先进的通用序列链接解决方案进行比较。
引用
@article{arxiv.1711.04248,
title = {Linking Sequences of Events with Sparse or No Common Occurrence across Data Sets},
author = {Yunsung Kim},
journal= {arXiv preprint arXiv:1711.04248},
year = {2017}
}