食品零售主题分布的建模:评估、可解释性与稳定性
应用统计
2021-02-25 v2 计算与语言
统计方法学
摘要
理解购物篮背后的购物动机在食品零售行业具有很高的商业价值。分析购物交易需要能够处理食品交易数据的体量与维度,同时保持结果可解释的技术。潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)提供了一种合适的框架来处理食品交易并发现客户购物动机的广泛表示。然而,对 LDA 模型的后验分布进行总结具有挑战性,且单个 LDA 抽样可能不连贯且无法捕捉主题不确定性。此外,LDA 模型的评估主要由模型拟合度量主导,这些度量可能无法充分捕捉诸如主题可解释性与稳定性等定性方面。在本文中,我们引入了一种聚类方法,对 LDA 后验抽样进行后处理,以总结整个后验分布并识别表示为反复出现主题的语义模式。我们的方法是标准标签切换技术的替代方案,提供一组单一的后验总结主题以及相关的不确定性度量。此外,我们建立了更全面的模型评估定义,不仅基于似然,还基于连贯性、区分度和稳定性来评估主题模型。通过一项调查,我们为食品零售数据领域中主题连贯性与主题相似性的解释设定了阈值。我们证明,通过我们的聚类方法选择反复出现的主题不仅提高了模型似然,还优于 LDA 的可解释性与稳定性等定性方面。我们在一个来自英国大型超市连锁店的实例上展示了我们的方法。
引用
@article{arxiv.2005.10125,
title = {Modelling Grocery Retail Topic Distributions: Evaluation, Interpretability and Stability},
author = {Mariflor Vega-Carrasco and Jason O'sullivan and Rosie Prior and Ioanna Manolopoulou and Mirco Musolesi},
journal= {arXiv preprint arXiv:2005.10125},
year = {2021}
}
备注
20 pages, 9 figures