我不是它们:大型语言模型中的流动身份与持久的群外偏见
计算与语言
2024-02-19 v1
摘要
我们探讨了 ChatGPT 在三种西方语言(即英语、德语和法语)和三种东方语言(即中文、日语和韩语)中的文化偏见——个人主义与集体主义。当 ChatGPT 在西方语言中采用个人主义人格时,其集体主义得分(即群外价值观)呈现出更负面的趋势,超过了其对个人主义(即群内价值观)的正面倾向。相反,当在东方语言中为 ChatGPT 分配集体主义人格时,也出现了类似的模式,即与集体主义(即群内价值观)相比,对个人主义(即群外价值观)的负面响应更多。结果表明,当被赋予特定的社会身份时,ChatGPT 能够区分群内和群外,拥抱群内价值观而摒弃群外价值观。值得注意的是,对群外的负面态度(偏见和歧视由此产生)超过了对群内的正面态度。该实验在政治领域进行了重复,结果保持一致。此外,这次重复揭示了大型语言模型 (LLM) 中固有的民主党偏见,这与早期的研究结果相吻合,并为通过提示工程缓解此类偏见提供了重要见解。我们使用不同的超参数和人格设置方法,在有或无社会身份标签的情况下,在其他流行的语言模型上进行了广泛的鲁棒性检验。
引用
@article{arxiv.2402.10436,
title = {I Am Not Them: Fluid Identities and Persistent Out-group Bias in Large Language Models},
author = {Wenchao Dong and Assem Zhunis and Hyojin Chin and Jiyoung Han and Meeyoung Cha},
journal= {arXiv preprint arXiv:2402.10436},
year = {2024}
}