中文

CommunityFish:一种基于泊松分布与层次聚类的文档标度方法

计算与语言 2023-08-30 v1 机器学习 社会与信息网络

摘要

文档标度一直是社会科学工作者文本即数据应用中的关键组成部分,也是政治研究者的重点关注领域,他们旨在借助不同的概率与非概率方法揭示说话者或政党间的差异。然而,这些技术大多要么建立在中立的词袋假设之上,要么使用借自外部来源的先验信息,这可能使结果嵌入显著偏差。若将语料库长期视为文档的集合,它也可被视为一个由相连词构成的稠密网络,其结构可基于词在文档中的共现(即所谓社群)进行聚类以区分独立的词群。本文引入CommunityFish作为Wordfish的增强版本,它基于词空间上的层次聚类(即Louvain算法)产生作为语义独立n-gram的社群(从语料库中涌现),并将其而非词空间作为Wordfish方法的输入。该策略强调了结果的可解释性,因为社群具有非重叠结构,从而在区分政党或说话者方面具备关键的信息力,此外还允许泊松标度模型更快执行。除产生被视为子话题代理的社群外,该技术的应用通过凸显美国国情咨文中的历史演进优于经典Wordfish模型,并且在使用政党立法宣言语料库时被发现能复现德国主流政治立场。

关键词

引用

@article{arxiv.2308.14873,
  title  = {CommunityFish: A Poisson-based Document Scaling With Hierarchical Clustering},
  author = {Sami Diaf},
  journal= {arXiv preprint arXiv:2308.14873},
  year   = {2023}
}