Twitter 数据揭示了怎样的未来?
计算机与社会
2023-08-07 v1 计算与语言
机器学习
社会与信息网络
摘要
预期是一种基本的人类认知能力,涉及思考未来并为之生活。尽管语言标记反映了预期性思维,但从自然语言处理视角出发的预期研究仍很有限。本研究旨在调查 Twitter 上未来学家所投射的未来,并探索语言线索对社交媒体用户预期性思维的影响。我们针对以下研究问题:Twitter 上的未来学家预期并分享了哪些未来,以及这些预期未来如何能从社会数据中建模。为此,我们回顾了关于预期的相关工作,讨论了语言标记与知名个人对预期性思维的影响,并提出了将未来分类为“当下未来”与“未来当下”的分类体系。本研究整理了一个由未来影响者公开分享的逾 100 万条推文组成的数据集,并利用 SOTA 模型开发了可扩展的 NLP 流水线。研究通过 LDA 方法识别出未来学家推文中的 15 个主题,并通过 BERTopic 方法识别出 100 个不同主题。这些发现有助于主题建模研究,并揭示了 Twitter 未来学家所预期的未来。研究表明,未来学家的语言线索标志着“正在形成的未来”,能增强社交媒体用户预期自身情境并当下做出回应。完全开源的数据集、交互式分析与可复现源代码均已提供以供进一步探索。
引用
@article{arxiv.2308.02035,
title = {What Twitter Data Tell Us about the Future?},
author = {Alina Landowska and Marek Robak and Maciej Skorski},
journal= {arXiv preprint arXiv:2308.02035},
year = {2023}
}