中文

在人口统计多样化空间社交媒体话语中理解词汇与情感本体

计算与语言 2023-11-14 v1

摘要

本研究旨在理解空间在线社交媒体评论数据中的语言与社会人口统计特征,涵盖英语语言风格、所传达情感以及词汇多样性。为此,我们开展了一项案例研究,审视由两个不同且人口统计多样化群体撰写的评论。我们的分析从这两个群体中提取并检查多种统计、语法与情感特征。随后,我们将这些特征与机器学习(ML)分类器结合,以辨别其在有效区分群体方面的潜力。我们的调查揭示了两组间某些语言属性的显著差异。当整合进 ML 分类器时,这些属性在区分群体上表现出显著效能,取得了约 0.85 的宏 F1 分数。此外,我们将这些语言特征与基于词 n-gram 的词汇特征在辨别人口统计多样化评论数据上进行了对比评估。正如预期,n-gram 词汇特征结合微调的基于 transformer 的模型展现出更优性能,准确率超过 95\% 且宏 F1 分数高于 0.96。我们细致的分析与综合评估证实了语言与情感特征在有效辨别人口统计多样化评论数据上的效能。本研究结果为未来关于跨各类社交媒体平台文本中人口统计模式分析的研究提供了宝贵指南。

关键词

引用

@article{arxiv.2311.06729,
  title  = {Comprehending Lexical and Affective Ontologies in the Demographically Diverse Spatial Social Media Discourse},
  author = {Salim Sazzed},
  journal= {arXiv preprint arXiv:2311.06729},
  year   = {2023}
}

备注

Accepted in 22nd IEEE International Conference on Machine Learning and Applications (ICMLA), 2023