中文

偏见根深蒂固:角色赋予型LLM中的隐式推理偏差

计算与语言 2024-01-30 v2

摘要

近期工作展示了LLM在回答中体现多样化角色(persona)的能力,例如提示语“你是尤达。解释相对论。”虽然该能力可实现LLM的个性化并支持人类行为模拟,但其对LLM能力的影响仍不清楚。为填补此空白,我们首次对角色赋予给LLM执行基础推理任务能力带来的非预期副作用进行了广泛研究。我们的研究涵盖24个推理数据集、4个LLM以及跨越5个社会人口群体的19种多样化角色(如一名亚洲人)。实验揭示,LLM在公平表象之下对社会人口群体抱有根深蒂固的偏见。当被直接问及(“黑人不擅长数学吗?”)时,它们公开拒绝刻板印象;但在被要求以某角色回答问题时,却表现出刻板且错误的预设。这些可观察为回答中的回避,例如“作为一名黑人,我无法回答此问题,因为它需要数学知识”,并通常导致性能大幅下降。我们对ChatGPT-3.5的实验表明,该偏见普遍存在——80%的角色表现出偏见;其程度显著——部分数据集性能下降超70%;且对某些群体尤其有害——部分角色在80%以上的数据集上出现统计显著的下降。总体而言,全部4个LLM在不同程度上表现出该偏见,其中GPT-4-Turbo偏见最少但仍存在问题(42%的角色中明显存在)。进一步分析表明,这些由角色引发的错误难以辨识且难以避免。我们的发现警示:为LLM赋予角色这一渐成趋势的做法,可能暴露其深层偏见并产生不可预见的有害副作用。

关键词

引用

@article{arxiv.2311.04892,
  title  = {Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs},
  author = {Shashank Gupta and Vaishnavi Shrivastava and Ameet Deshpande and Ashwin Kalyan and Peter Clark and Ashish Sabharwal and Tushar Khot},
  journal= {arXiv preprint arXiv:2311.04892},
  year   = {2024}
}

备注

Project page: https://allenai.github.io/persona-bias. Paper to appear at ICLR 2024. Added results for other LLMs in v2 (similar findings)