中文

ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context

计算与语言 2025-08-27 v3 人工智能

摘要

虽然语言模型在生产中的偏见有所记录,但它们的 guardrail 偏见被忽略了。本文研究了关于用户的上下文信息如何影响 LLM 执行请求的可能性。通过生成提供意识形态和人口统计信息的用户简介,我们发现 GPT-3.5 中存在多种 guardrail sensitivity 偏见。较年轻、女性和亚裔美国人的 persona 更可能在请求被 censured 或非法信息时触发拒绝 guardrail。guardrail 也具有迎合性,拒绝执行请求者可能不同意的政治立场的请求。我们发现,某些身份群体和看似无害的信息(例如,体育迷)都能引发类似直接政治意识形态陈述的 guardrail sensitivity 变化。对于每个人口统计类别,甚至对于美国橄榄球队迷,我们发现 ChatGPT 似乎会推断出可能的政治意识形态并相应修改 guardrail 行为。

关键词

引用

@article{arxiv.2407.06866,
  title  = {ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context},
  author = {Victoria R. Li and Yida Chen and Naomi Saphra},
  journal= {arXiv preprint arXiv:2407.06866},
  year   = {2025}
}