行动胜于言语:代理决策揭示语言模型中的隐性偏见
计算与语言
2025-01-30 v1 人工智能
人机交互
摘要
尽管公平性和对齐方面的进步已有所帮助,成功减轻了大型语言模型 (LLMs) 在明确提示下表现的显性偏见,但我们假设这些模型在模拟人类行为时可能仍然表现出隐性偏见。为测试这一假设,我们提出了一种系统性揭示此类偏见的技术方法,通过评估具有 LLM 生成、依据社会人口统计特征的人格的代理之间的决策差异。使用我们的技术方法,我们测试了六个 LLMs 跨越三个社会人口统计群体和四个决策情境。我们的结果显示,最先进的 LLMs 在几乎所有模拟情境中都表现出显著的社会人口统计差异,尽管减少了显性偏见,但更先进的模型反而表现出更大的隐性偏见。此外,当将我们的发现与来自实证研究的真实世界差异进行比较时,我们发现我们所发现的偏见是方向性匹配的,但放大程度显著。这种方向性匹配凸显了我们技术方法在揭示 LLMs 中系统性偏见(而非随机变动)的实用性;此外,隐性偏见的存在与放大进一步强调了需要新策略来解决这些偏见的必要性。
引用
@article{arxiv.2501.17420,
title = {Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models},
author = {Yuxuan Li and Hirokazu Shirado and Sauvik Das},
journal= {arXiv preprint arXiv:2501.17420},
year = {2025}
}