中文

黑箱情感推断模型中存在高度政治偏见

计算与语言 2024-11-22 v2 人工智能

摘要

本文探讨了情感推断模型中是否存在政治偏见,这类模型常用于社会科学研究中的情感分析(sentiment analysis, SA)。机器学习模型往往反映其训练数据中的偏见,从而影响结果的有效性。虽然已有研究聚焦于性别和种族偏见,但本研究聚焦于政治偏见——这一在广泛的研究中可能扭曲文本数据解读的潜在且普遍的问题。我们对本实验室开发的波兰情感分析模型进行了偏差审计。通过分析涉及波兰政治人物的姓名和句子的价值(valence)预测,我们发现受政治派系影响的系统性差异。我们的发现表明,人类评审者的标注会将政治偏见传递到模型的预测中。为缓解此问题,我们修剪了包含这些政治人物文本的训练数据集,观察到偏见有所减少,但未能完全消除。鉴于政治偏见在情感分析中的重大影响,本研究强调在社会科学研究中谨慎使用此类模型的必要性。我们建议对情感分析结果进行批判性检验,并提出使用基于词典的系统作为更具中立 ideology 的替代方案。本文强调了为确保机器学习在学术和实际应用语境下可靠性和公正性所需的持续审查和方法论调整。

关键词

引用

@article{arxiv.2407.13891,
  title  = {High Risk of Political Bias in Black Box Emotion Inference Models},
  author = {Hubert Plisiecki and Paweł Lenartowicz and Maria Flakus and Artur Pokropek},
  journal= {arXiv preprint arXiv:2407.13891},
  year   = {2024}
}