中文

大语言模型对齐性检验:基于代表性启发式方法的政治偏见案例

计算与语言 2025-03-04 v3 人工智能

摘要

检验大型语言模型(LLM)的对齐性日益重要,例如当 LLM 未能按预期运行时。本研究聚焦于 LLM 在政治领域与人类价值观的对齐性。先前研究表明,LLM 生成的输出可能包含政治倾向,并模仿政党在 various 问题上的立场。然而,LLM 偏离经验立场的程度与条件仍不充分探讨。为填补这一空白,我们分析导致 LLM 在政治议题上偏离经验立场的因素,旨在量化这些偏离并识别其成因。drawing on 认知科学中关于 representativeness heuristics 的发现,即人类倾向于基于目标群体的代表性属性进行判断,导致夸大信念,我们从该启发式的视角审视 LLM 的响应。我们进行实验以确定 LLM 如何对政治党派的预测进行夸大,从而导致刻板印象。我们发现,尽管 LLM 能够模仿某些政治党派的立场,但它们往往比人类调查受访者更夸大这些立场。此外,LLM 倾向于比人类更强调 representativeness。本研究突显了 LLM 受 representativeness heuristics 影响的脆弱性,表明其可能导致政治刻板印象。我们还测试了基于 prompt 的缓解策略,发现能够缓解人类代表性启发式的策略在减少 LLM 响应中代表性影响方面同样有效。

关键词

引用

@article{arxiv.2501.14294,
  title  = {Examining Alignment of Large Language Models through Representative Heuristics: The Case of Political Stereotypes},
  author = {Sullam Jeoung and Yubin Ge and Haohan Wang and Jana Diesner},
  journal= {arXiv preprint arXiv:2501.14294},
  year   = {2025}
}

备注

ICLR 2025