基于种子词的植入泊松分解:利用领域知识拟合主题模型
统计方法学
2025-10-07 v2 计算与语言
机器学习
综合经济学
经济学
摘要
主题模型广泛用于发现大文本语料库中隐藏的主题结构,但传统的无监督方法往往难以与预定义的概念域对齐。本文引入植入泊松分解(SPF),一种新方法,通过种子词将领域知识纳入泊松分解(PF)框架。SPF 通过修改主题特定术语强度的先验分布,为预定义的种子词分配更高的初始速率,从而实现结构化的主题发现。该模型使用变分推断结合随机梯度优化进行估计,确保可扩展到大型数据集。我们详细报告了将 SPF 应用于 Amazon 客户反馈数据集的结果,利用预定义的产品类别作为指导结构。SPF 在计算效率和分类性能方面均优于另一些引导概率主题模型。鲁棒性检查凸显了 SPF 在不完美的种子词选择情况下,仍能灵活地平衡领域知识与数据驱动的主题发现能力。进一步的应用表明,SPF 在四个其他基准数据集上也能实现优于未植入 SPF 模型的优异分类性能。
引用
@article{arxiv.2503.02741,
title = {Seeded Poisson Factorization: leveraging domain knowledge to fit topic models},
author = {Bernd Prostmaier and Jan Vávra and Bettina Grün and Paul Hofmarcher},
journal= {arXiv preprint arXiv:2503.02741},
year = {2025}
}