中文

LLM中的政治偏见:基于智能体模拟的非对齐道德价值观

计算与语言 2025-07-15 v2 人工智能

摘要

社会科学领域的当代研究越来越多地利用最先进的生成语言模型来标注或生成内容。尽管这些模型在常见语言任务上取得了基准领先的性能,但它们在新异域任务上的应用仍探索不足。为填补这一空白,我们研究了个性化语言模型在道德基础理论问卷上如何与人类回答对齐。我们将开源生成语言模型适配到不同的政治人设,并反复调查这些模型以生成合成数据集,其中模型-人设组合定义了我们的子群体。分析表明,模型在多次重复中产生不一致的结果,导致较高的响应方差。此外,合成数据与来自心理学研究的对应人类数据之间的对齐表现出弱相关性,特别是保守人设提示的模型尤其未能与实际保守群体对齐。这些结果表明,由于对齐过程,语言模型难以通过上下文提示连贯地表征意识形态。因此,使用语言模型模拟社会互动需要在上下文优化或参数操控方面进行可衡量的改进,以正确对齐心理和社会学刻板印象。

关键词

引用

@article{arxiv.2408.11415,
  title  = {Political Bias in LLMs: Unaligned Moral Values in Agent-centric Simulations},
  author = {Simon Münker},
  journal= {arXiv preprint arXiv:2408.11415},
  year   = {2025}
}

备注

14 pages, 2 tables