中文

维基百科中 LGBT 人群刻画的多语言上下文情感分析

计算与语言 2021-04-09 v2

摘要

叙事文本中特定的词汇选择既反映了作者对所叙人物的态度,也影响受众的反应。已有研究利用上下文情感分析(一种旨在沿权力、能动性与情感维度分析人物被刻画方式的自然语言处理(NLP)技术)考察了英语中对人物的描述。我们的工作将该方法拓展至多语言场景,这得益于我们收集的新语料库与新的多语言模型。我们进一步展示了词语内涵如何因语言与文化而异,凸显了将现有英语数据集与方法泛化的困难。随后,我们通过分析英语、俄语和西班牙语三种语言中 LGBT 群体成员的维基百科传记页,展示了方法的有效性。结果表明,LGBT 群体在不同语言中的刻画存在系统性差异,揭示了叙事中的文化差异与社会偏见迹象。在实践中,该模型可用于识别需进一步人工分析的维基百科文章——那些可能含有内容缺口或对特定社会群体表征不平衡的文章。

关键词

引用

@article{arxiv.2010.10820,
  title  = {Multilingual Contextual Affective Analysis of LGBT People Portrayals in Wikipedia},
  author = {Chan Young Park and Xinru Yan and Anjalie Field and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2010.10820},
  year   = {2021}
}

备注

ICWSM 2021