ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context
计算与语言
2025-08-27 v3 人工智能
摘要
虽然语言模型在生产中的偏见有所记录,但它们的 guardrail 偏见被忽略了。本文研究了关于用户的上下文信息如何影响 LLM 执行请求的可能性。通过生成提供意识形态和人口统计信息的用户简介,我们发现 GPT-3.5 中存在多种 guardrail sensitivity 偏见。较年轻、女性和亚裔美国人的 persona 更可能在请求被 censured 或非法信息时触发拒绝 guardrail。guardrail 也具有迎合性,拒绝执行请求者可能不同意的政治立场的请求。我们发现,某些身份群体和看似无害的信息(例如,体育迷)都能引发类似直接政治意识形态陈述的 guardrail sensitivity 变化。对于每个人口统计类别,甚至对于美国橄榄球队迷,我们发现 ChatGPT 似乎会推断出可能的政治意识形态并相应修改 guardrail 行为。
引用
@article{arxiv.2407.06866,
title = {ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context},
author = {Victoria R. Li and Yida Chen and Naomi Saphra},
journal= {arXiv preprint arXiv:2407.06866},
year = {2025}
}