中文

面向可扩展统计关系模型发现的预计数与后计数

机器学习 2021-10-20 v1 人工智能 数据库

摘要

统计关系模型发现旨在从关系数据中找到统计相关模式。例如,关系依赖模式可规定用户性别与其好友性别相关联。如同命题(非关系)图模型,模型发现的主要可扩展性瓶颈是计算实例化计数:关系模式在数据库中实例化的次数。先前命题学习工作利用预计数或后计数解决该任务。本文详细考察关系学习中预计数与后计数策略在内存与速度上的权衡。预计数方法在模型搜索前计算并缓存大量关系模式的实例化计数;后计数方法在模型搜索中为生成的每个候选模式按需动态计算实例化计数。我们描述一种专为关系数据定制的混合新方法,对涉及正关系(如互为好友的用户对)的模式使用预计数、对涉及负关系(如非好友的用户对)的模式使用后计数,从而取得最佳平衡。我们的混合方法将模型发现扩展到数百万数据事实。

关键词

引用

@article{arxiv.2110.09767,
  title  = {Pre and Post Counting for Scalable Statistical-Relational Model Discovery},
  author = {Richard Mar and Oliver Schulte},
  journal= {arXiv preprint arXiv:2110.09767},
  year   = {2021}
}

备注

Presented at the Tenth International Workshop on Statistical Relational AI at the 1st International Joint Conference on Learning & Reasoning