检验话语主题的协变量效应假设
统计方法学
2025-11-05 v2 机器学习
摘要
我们提出了一种面向大型文本语料库的话语模型方法,能够保持可计算性。这通过淡化底层概率模型中参数估计的作用来实现,假设数据来自固定但未知分布,其统计功能量感兴趣。我们提出将凸形式的非负矩阵分解与标准回归技术相结合,以快速可计算且实用地估计此类功能量。随后,可通过对该方案叠加非参数抽样方法来实现不确定性量化。这与流行的话语模型范例不同,后者假设数据具备复杂且往往难以拟合的生成模型。我们认为,此处所主张的简单、非参数方法在速度、可解释性和推理正当性方面均优于上述生成模型。最后,以分析加拿大啤酒所归因的风味话语中的协变量效应为例,展示了本方法的应用。
引用
@article{arxiv.2506.05570,
title = {Testing Hypotheses of Covariate Effects on Topics of Discourse},
author = {Gabriel Phelan and David A. Campbell},
journal= {arXiv preprint arXiv:2506.05570},
year = {2025}
}