用于识别作者误归因的社交媒体截图分类
信息检索
2024-10-10 v1
摘要
误/虚假信息是社交媒体上常见且危险的现象。误归因是一种误/虚假信息形式,涉及对作者归属的错误声称,即用户声称他人说(发布)了自己从未说过或发布过的内容。我们讨论了误信息与虚假信息之间的区别,以及如何在社交媒体平台上使用截图传播作者误归因。要能够找到截图的原始帖子,以确定截图是否被正确归因,就至关重要。为此,我们构建了几项工具来辅助自动化搜索过程。第一项是一个 Python 脚本,旨在根据帖子结构对 Twitter 帖子进行分类,提取截图的元数据,并使用此数据将所有位于同一截图内的帖子分组。我们在手工收集的 75 条包含截图的 Twitter 帖子上测试了此过程,以确定脚本提取元数据和对单个帖子进行分组的效果,F1=0.80。第二项是一系列爬虫,用于收集可用于训练和测试模型以区分各种社交媒体平台的数据集。我们收集了 16,620 张截图来自 Facebook、Instagram、Truth Social 和 Twitter。截图由爬虫针对每个平台的网页版和移动版,以及两种配色方案(浅色模式和深色模式)进行拍摄。
引用
@article{arxiv.2410.06443,
title = {Categorizing Social Media Screenshots for Identifying Author Misattribution},
author = {Ashlyn M. Farris and Michael L. Nelson},
journal= {arXiv preprint arXiv:2410.06443},
year = {2024}
}