通过自然语言处理与机器学习揭示低和平与高和平国家新闻媒体的词语差异
计算机与社会
2024-10-24 v1
摘要
语言既是导致冲突或和平的社会过程的原因,也是其结果。仇恨言论可煽动暴力与破坏。反映并支持维持和平的社会过程的和平言论具有哪些特征?本研究利用已有的和平指数、机器学习以及在线新闻媒体来源,识别与低和平国家相对于高和平国家最相关的词语。由于每个和平指数衡量不同的社会属性,这些指数的数值鲜有共识。然而,对于这些处于低和平与高和平极端的国家,各指数间有较大的共识。因此,采用数据驱动的方法寻找对区分低和平与高和平国家最重要的词语。本研究并非假设一个预测哪些词语更可能出现在低和平与高和平国家的理论框架,再于新闻媒体中搜寻那些词语,而是使用自然语言处理与机器学习来识别最准确将国家分类为低和平或高和平的词语。一旦机器学习模型在来自极端低和平与高和平国家的词频上训练完成,该模型也被用于为这些国家及其他中间和平国家计算定量和平指数。该模型成功地为未出现在训练集中的中间和平国家给出了介于低和平与高和平之间的定量和平指数。本研究展示了自然语言处理与机器学习如何帮助生成社会系统的新定量测度,在本研究中即为导致不同和平程度国家定量和平指数的语言差异。
引用
@article{arxiv.2305.12537,
title = {Word differences in news media of lower and higher peace countries revealed by natural language processing and machine learning},
author = {Larry S. Liebovitch and William Powers and Lin Shi and Allegra Chen-Carrel and Philippe Loustaunau and Peter T. Coleman},
journal= {arXiv preprint arXiv:2305.12537},
year = {2024}
}
备注
21 pages, 4 figures