健康的 Twitter 讨论?时间会给出答案
社会与信息网络
2022-05-13 v2 机器学习
摘要
研究错误信息以及如何处理在线讨论中的不健康行为,近来已成为社会研究中一个重要领域。随着社交媒体的快速发展,以及可用信息和来源的不断增多,对此类话语进行严格的人工分析已变得不可行。许多方法通过遵循监督式方法研究讨论的语义和句法属性来应对该问题,例如对标注为滥用、虚假或机器人生成内容的数据集使用自然语言处理。基于存在 ground truth 的解决方案仅限于那些可能拥有 ground truth 的领域。然而,在错误信息的语境中,为实例分配标签可能困难甚至不可能。在此背景下,我们考虑使用时态动态模式作为讨论健康程度的指标。在一个当时缺乏 ground truth 的领域(早期 COVID-19 大流行讨论)中工作,我们探索基于贡献量和贡献时间对讨论进行刻画。首先我们以无监督方式探索讨论的类型,随后使用我们形式化的“短暂性”概念对这些类型进行刻画。最后,我们讨论了基于讨论的可取性、健康性和建设性,利用我们的短暂性定义对在线话语进行标注的潜在用途。
引用
@article{arxiv.2203.11261,
title = {Healthy Twitter discussions? Time will tell},
author = {Dmitry Gnatyshak and Dario Garcia-Gasulla and Sergio Alvarez-Napagao and Jamie Arjona and Tommaso Venturini},
journal= {arXiv preprint arXiv:2203.11261},
year = {2022}
}
备注
15 pages. Related to the SoBigData++ project: https://plusplus.sobigdata.eu/