分析误导信息中语言特征的时序动态
计算与语言
2025-03-11 v2 社会与信息网络
摘要
误导信息的消费可能导致对个人和社会的负面影响。为帮助减轻误导信息对人类信念的影响,已开发出提供内容准确性和来源可靠性信息的算法标签。由于用于估计信息准确性的语言特征会随时间变化,理解其时序动态至关重要。因此,本研究使用自然语言处理技术分析2010至2024年间的PolitiFact声明,以量化不同五年时期内误导信息来源和语言特征的变化。结果显示,随着时间的推移,声明情感显著下降,反映出PolitiFact声明中整体更负面的语调。此外,与误导信息相关的声明情感显著低于准确信息。进一步分析显示,近期时期主要来自线上社交网络和其他数字论坛(如博客和病毒性图像)的来源,这些来源的误导信息水平高且包含负面情感。相比之下,早期时期的大多数声明归因于个人来源(即政客),这些来源在准确度评级上相对平衡,且包含中性或积极情感的声明。通过命名实体识别识别出,总统在位者和候选人在包含误导信息的声明中相对更常见,而美国州在准确信息中更常出现。最后,与误导信息相关的实体标签更常包含人物和组织机构,而准确声明更可能包含数字实体标签,如百分比和日期。
关键词
引用
@article{arxiv.2503.04786,
title = {Analyzing the temporal dynamics of linguistic features contained in misinformation},
author = {Erik J Schlicht},
journal= {arXiv preprint arXiv:2503.04786},
year = {2025}
}