中文

通过面向目标的情感分类分析 LLM 中的政治偏见

计算与语言 2025-05-27 v1 人工智能

摘要

LLM 编码的政治偏见可能对下游应用产生不利影响。现有的偏见分析方法依赖于小规模的中间任务(问卷回答或政治内容生成),并依赖 LLM 自身进行分析,从而传播了偏见。我们提出了一种新方法,利用在相同句子中 LLM 的情感预测随目标实体变化这一观察。我们定义了一个基于熵的不一致性度量来编码这种预测变异性。我们将 1319 个在人口统计学和政治上具有多样性的政治家姓名插入 450 个政治句子中,并使用六种广泛使用的语言中的七个模型预测面向目标的情感。我们在所有测试组合中观察到不一致性,并在不同粒度水平上通过统计稳健的分析将它们聚合。我们观察到对左翼和极右翼政治家的正面和负面偏见,以及具有相似立场的政治家之间的正面相关性。西方语言的偏见强度高于其他语言。较大的模型表现出更强、更一致的偏见,并减少了相似语言之间的差异。通过用虚构但合理的对应者替换政治家姓名,我们部分缓解了 LLM 在面向目标的情感分类(TSC)中的不可靠性。

关键词

引用

@article{arxiv.2505.19776,
  title  = {Analyzing Political Bias in LLMs via Target-Oriented Sentiment Classification},
  author = {Akram Elbouanani and Evan Dufraisse and Adrian Popescu},
  journal= {arXiv preprint arXiv:2505.19776},
  year   = {2025}
}

备注

To be published in the Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)