识别帮派相关社交媒体通信时的词汇偏差认知
计算与语言
2023-04-25 v1 人工智能
机器学习
社会与信息网络
摘要
参与帮派相关活动的个体使用包括 Facebook 和 Twitter 在内的主流社交媒体来表达嘲讽与威胁,以及悲伤与悼念。然而,为通过社交媒体来源满足社区成员需求而识别帮派相关活动的影响,存在一系列独特挑战。这包括在伦理上难以识别受帮派活动影响的个体的训练数据,以及需要考量这些个体推文中常用的非标准语言风格。我们的研究提供了证据,表明自然语言处理工具可有助于高效识别可能亟需社区关怀资源(如咨询师、冲突调解员或学术/职业培训项目)的个体。我们证明,使用与芝加哥相关的帮派推文样本,我们的二分类逻辑回归分类器在识别受帮派相关暴力影响的个体方面优于基线标准。我们最终发现,推文的语言高度相关,且“大数据”方法或机器学习模型需更好地理解语言如何影响模型性能及其在不同人群中的判别方式。
引用
@article{arxiv.2304.11485,
title = {Understanding Lexical Biases when Identifying Gang-related Social Media Communications},
author = {Dhiraj Murthy and Constantine Caramanis and Koustav Rudra},
journal= {arXiv preprint arXiv:2304.11485},
year = {2023}
}