社交媒体中的性别认同与词汇变异
计算与语言
2014-05-13 v2
摘要
我们利用一个包含 14,000 名 Twitter 用户的新语料库,呈现了一项关于性别、语言风格与社交网络之间关系的研究。先前关于性别的定量工作常将此社会变量视为女/男二元对立;我们主张一种更细致的方法。通过对 Twitter 用户进行聚类,我们发现该数据集可自然分解为多种风格和主题兴趣。许多聚类具有强烈的性别倾向,但其对语言资源的使用有时直接与总体层面的语言统计数据相冲突。我们将这些聚类视为对性别化语言风格多面性更准确的反映。先前基于语料库的工作也很少涉及那些语言风格违背总体性别模式的个体。为了识别此类个体,我们训练了一个统计分类器,并测量数据集中每个个体的分类器置信度。通过检查那些语言不符合其性别分类器模型的个体,我们发现他们的社交网络中包含显著更少的同性社交连接,且总体而言,社交网络同质性与同性语言标记的使用相关。因此,将计算方法与社会理论相结合,为性别如何作为个体相对于受众、主题和主流性别规范进行定位而涌现提供了新的视角。
引用
@article{arxiv.1210.4567,
title = {Gender identity and lexical variation in social media},
author = {David Bamman and Jacob Eisenstein and Tyler Schnoebelen},
journal= {arXiv preprint arXiv:1210.4567},
year = {2014}
}
备注
submission version