一种用于量化文本语料库中预定义主题动态显著性的自然语言处理方法
计算与语言
2021-08-18 v1
摘要
在线新闻媒体的激增同时为旨在刻画和理解感兴趣地理位置的社会与文化趋势的分析师提供了宝贵资源和重大挑战。尽管大量记录重大事件、趋势和响应的新闻报道提供了某地社会特征的更民主化图景,但理解整个语料库以提取重大趋势对任何单个分析师或团队而言都是严峻挑战。在此,我们提出一种利用自然语言处理技术的方法,旨在量化一组预定义感兴趣主题在大型文本语料库随时间的演变。我们发现,给定预定义主题,我们可以识别并排序映射到这些主题且使用模式偏离正常基线的术语集或n-gram。n-gram使用的出现、消失或显著变化提供了语料库中主题动态显著性的自下而上图景。
引用
@article{arxiv.2108.07345,
title = {An NLP approach to quantify dynamic salience of predefined topics in a text corpus},
author = {A. Bock and A. Palladino and S. Smith-Heisters and I. Boardman and E. Pellegrini and E. J. Bienenstock and A. Valenti},
journal= {arXiv preprint arXiv:2108.07345},
year = {2021}
}
备注
This paper was presented at the 2021 International Conference on Social Computing, Behavioral-Cultural Modeling Prediction and Behavior Representation in Modeling and Simulation (SBP-BRiMS), 9 July 2021