面向大规模政治文本的在线张量 LDA
机器学习
2026-01-14 v1 社会与信息网络
摘要
本文提出一种可扩展至数十亿文档的主题建模方法。我们作出三项核心贡献:i) 我们提出一种主题建模方法,张量潜在 Dirichlet 分配 (Tensor Latent Dirichlet Allocation, TLDA),其具有可辨识且可恢复的参数保证以及大数据样本复杂度保证;ii) 我们表明该方法在计算和内存效率上具有优势(相较于先前的并行潜在 Dirichlet 分配 (LDA) 方法,速度提升 3-4 倍),且可线性扩展至文档数超过十亿的文本数据集;iii) 我们提供了一个开源的 GPU 实现。这种扩展使得此前不可行的分析成为可能,我们进行了两项大规模新研究,针对政治学家的兴趣:我们首次通过超过两年的推特对话,对 #MeToo 运动的演变进行深入分析;以及对 2020 年总统大选中选舞 fraud 社交媒体讨论的详细研究。因此,该方法为社会科学家提供了大规模语料库的分析能力,使其能够就近实时回答关于突出性议题的重要理论问题。
引用
@article{arxiv.2511.07809,
title = {Analyzing Political Text at Scale with Online Tensor LDA},
author = {Sara Kangaslahti and Danny Ebanks and Jean Kossaifi and Anqi Liu and R. Michael Alvarez and Animashree Anandkumar},
journal= {arXiv preprint arXiv:2511.07809},
year = {2026}
}
备注
64 pages, 11 figures