中文

疫情相关内容的语言学模式:新冠肺炎、约束与单纯瘟疫数据集的比较分析

计算与语言 2025-10-10 v1 人工智能 机器学习

摘要

本研究对疫情相关的网络讨论进行计算语言学分析,考察语言如何区分健康误导信息与事实性信息。本文基于三个语料库:新冠肺炎虚假叙事(n=7588)、一般新冠肺炎内容(n=10700)和单纯瘟疫相关帖子(n=5787),识别出可读性、修辞标记和说服性语言使用的显著差异。新冠肺炎误导信息的可读性得分显著降低,且包含两倍以上的恐惧相关或说服性术语频率,与其他数据集形成鲜明对比。其次,误导信息中几乎不使用感叹号,而单纯瘟疫内容则更情绪化。这些模式表明,误导信息采用一种嵌含情感线索的刻意复杂修辞风格,这种组合可能增强其 perceived credibility。我们的发现为数字健康误导信息研究的日益增长的文献做出了贡献,突出了有助于检测的语言指示符。它们也为公共卫生信息传播策略和网络媒体环境中的危机传播理论模型提供了启发。与此同时,本研究认识到局限性,包括依赖传统可读性指数、使用精心挑选的说服词汇表,以及依赖静态聚合分析。未来研究应 therefore 纳入纵向设计、更广泛的情感词汇表和平台敏感方法,以增强鲁棒性。

关键词

引用

@article{arxiv.2510.07579,
  title  = {Linguistic Patterns in Pandemic-Related Content: A Comparative Analysis of COVID-19, Constraint, and Monkeypox Datasets},
  author = {Mkululi Sikosana and Sean Maudsley-Barton and Oluwaseun Ajao},
  journal= {arXiv preprint arXiv:2510.07579},
  year   = {2025}
}

备注

16 pages