在线仇恨言论、虚假信息与总体心理健康的拓扑数据映射:一项基于大语言模型的研究
机器学习
2023-09-26 v1 代数拓扑
神经元与认知
摘要
社交媒体的出现引发对其传播仇恨言论与虚假信息之潜在影响的日益关切,除助长偏见与歧视外,还被怀疑在美国社会暴力与犯罪上升中发挥作用。尽管文献已表明网络发布仇恨言论与虚假信息同发布者某些人格特质存在关联,但在线仇恨言论/虚假信息与发布者整体心理健康之间的普遍关系与相关性仍不明朗。一大困难在于缺乏足以分析海量社交媒体帖子以揭示潜在隐藏关联的数据分析工具。机器学习与大语言模型(如 ChatGPT)的最新进展使此类分析成为可能。本研究中,我们从社交媒体 Reddit 上精心选取的社区收集数千条帖子,继而利用 OpenAI 的 GPT3 推导这些帖子的嵌入表示——即高维实数向量,据信表征帖子的隐藏语义。随后基于这些嵌入进行多种机器学习分类,以理解仇恨言论/虚假信息在各社区中的作用。最后,对嵌入施加拓扑数据分析(TDA)以获得连接在线仇恨言论、虚假信息、各类精神障碍与总体心理健康的视觉映射。
引用
@article{arxiv.2309.13098,
title = {Topological Data Mapping of Online Hate Speech, Misinformation, and General Mental Health: A Large Language Model Based Study},
author = {Andrew Alexander and Hongbin Wang},
journal= {arXiv preprint arXiv:2309.13098},
year = {2023}
}
备注
43 pages