中文

小规模数据投毒是否加剧大语言模型中的方言关联偏见?

计算与语言 2025-10-10 v2 人工智能 机器学习

摘要

识别出风格条件数据投毒作为放大大语言模型中社会语言偏见的隐蔽途径。通过将少量投毒预算与主要为非裔美国英语(AAVE)和南方方言的方言提示配对,搭配带有毒性或刻板印象完成内容进行指令调优,本工作探讨语言风格是否可作为有害行为的潜在触发器。在多个模型家族和规模下,投毒后暴露会提升方言输入的毒性和刻板印象表达——尤其是AAVE最为一致,而标准美式英语则相对较低但并非完全免受影响。结合基于分类器的毒性评估与LLM评判器,发现即使词汇层面的毒性看似平淡,仍会呈现刻板印象内容,表明常规检测器低估了社会语言伤害。此外,投毒模型还表现出尽管未出现显性污秽词汇,却出现了新兴的越狱行为,暗示对齐机制被削弱而非记忆效应。这些发现凸显了方言意识的评估需求、内容层面的刻板印象审计,以及训练过程中需显式解耦风格与毒性的必要性,以防止通过看似微小的风格化污染放大偏见。

关键词

引用

@article{arxiv.2507.19195,
  title  = {Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?},
  author = {Chaymaa Abbas and Mariette Awad and Razane Tajeddine},
  journal= {arXiv preprint arXiv:2507.19195},
  year   = {2025}
}