中文

Familia:面向工业文本工程的可配置主题建模框架

计算与语言 2018-08-15 v2 信息检索 机器学习

摘要

过去十年中,多种主题模型被提出用于文本工程。然而,除概率潜在语义分析(PLSA)与潜在狄利克雷分配(LDA)外,现有大多数主题模型在工业场景中极少被应用或考量。这一现象源于迄今支持这些主题模型的便捷工具十分匮乏。由于设计与实现参数推断算法所需专业知识和劳力令人望而生畏,软件工程师倾向于直接求助于 PLSA/LDA,而不考虑其是否适合手头问题。本文提出一个名为 Familia 的可配置主题建模框架,以弥合学术研究成果与当前工业实践间的巨大鸿沟。Familia 支持一系列在文本工程场景中广泛适用的主题模型。为减轻无贝叶斯网络知识的软件工程师的负担,Familia 能对多种主题模型进行自动参数推断。仅需改变 Familia 的数据组织方式,软件工程师即可轻松探索广泛的现有主题模型甚至设计自己的主题模型,并找到最契合手头问题的那一个。凭借优越的可扩展性,Familia 拥有一种在参数推断效果与效率间取得平衡的崭新采样机制。此外,Familia 本质上是一个支持并行参数推断与分布式参数存储的大型主题建模框架。Familia 的效用与必要性已在真实工业应用中得到验证。Familia 将显著扩充软件工程师的主题模型武器库,并为在真实问题中运用高度定制化的主题模型铺平道路。

关键词

引用

@article{arxiv.1808.03733,
  title  = {Familia: A Configurable Topic Modeling Framework for Industrial Text Engineering},
  author = {Di Jiang and Yuanfeng Song and Rongzhong Lian and Siqi Bao and Jinhua Peng and Huang He and Hua Wu},
  journal= {arXiv preprint arXiv:1808.03733},
  year   = {2018}
}

备注

21 pages, 15 figures