中文

Twitter-Demographer:一种用于丰富Twitter数据的基于流的工具

计算与语言 2022-01-27 v1

摘要

Twitter数据已成为自然语言处理(NLP)和社会科学研究不可或缺的部分,近年来推动了各种科学发现。然而,仅文本数据往往不足以开展研究:尤其是社会科学家需要更多变量来执行其分析并控制各种因素。我们如何扩充这些信息(如用户位置、年龄或推文情感)对匿名性和可重复性有影响,且需要专门投入。本文描述Twitter-Demographer,一种简单的、基于流的用于以推文和用户附加信息丰富Twitter数据的工具。Twitter-Demographer面向想要用聚合信息丰富其数据集的NLP从业者和(计算)社会科学家,促进可重复性,并提供算法性的隐私保护设计措施以实现伪匿名。我们讨论了受基于流的编程范式启发而做出的设计选择,即使用可轻松链式组合与扩展的黑盒组件。我们还分析了使用该工具相关的伦理问题,以及促进伪匿名的内置措施。

关键词

引用

@article{arxiv.2201.10986,
  title  = {Twitter-Demographer: A Flow-based Tool to Enrich Twitter Data},
  author = {Federico Bianchi and Vincenzo Cutrona and Dirk Hovy},
  journal= {arXiv preprint arXiv:2201.10986},
  year   = {2022}
}