中文

基于主题模型采样效应的文化尺度论断评估探索

数字图书馆 2017-02-14 v3 计算与语言 信息检索

摘要

全文文档的文化尺度模型容易被研究人员过度解读,从而无意中做出强有力的社会语言学论断(Pechenick et al., 2015),而未认识到即便大型数字图书馆也仅仅是历来出版所有书籍的样本。在本研究中,我们通过从国会图书馆分类大纲的不同领域抽取 Hathi Trust 数字图书馆中书籍的随机样本,检验主题模型对采样过程的敏感性。对于每个分类领域,我们使用不同的随机种子在整个类别上训练若干主题模型,生成一组跨度模型。然后,我们在该分类领域中书籍的随机样本上训练主题模型,生成一组样本模型。最后,我们通过计算各主题词概率分布之间的 Jensen-Shannon 距离(JSD)来执行每对模型间的主题对齐。我们对每次模型对齐采取两种度量:对齐距离与主题重叠度。我们发现,具有大样本量的样本模型其对齐距离通常落在跨度模型间对齐距离的范围内。不出所料,随着样本量增大,对齐距离减小。我们还发现主题重叠度随样本量增大而增大。然而,这些度量按样本量的分解因主题数和分类领域而异。我们推测,这些度量可用于发现那些在该领域所有书籍中讨论共同“经典”的类别,其表现为即便在小样本量下也具有高主题重叠度和低对齐距离。

关键词

引用

@article{arxiv.1512.05004,
  title  = {Towards Evaluation of Cultural-scale Claims in Light of Topic Model Sampling Effects},
  author = {Jaimie Murdock and Jiaan Zeng and Colin Allen},
  journal= {arXiv preprint arXiv:1512.05004},
  year   = {2017}
}

备注

2016 International Conference on Computational Social Science (IC2S2), June 23-26, 2016. 3 pages