中文

导航rabbit陷阱:LLM 生成的针对精神健康群体的攻击叙事中的新兴偏见

计算与语言 2026-01-30 v4 人工智能 计算机与社会 机器学习 社会与信息网络

摘要

大型语言模型(LLM)已显示出对某些群体的不平衡偏见。然而,针对 LLM 对高危人群(尤其是精神健康群体)发起未经 provocation 的有针对性攻击的研究仍属未探索之地。我们的论文提出了三个新贡献:(1)对 LLM 生成的针对高度脆弱精神健康群体的攻击进行明确评估;(2)建立一种基于网络的框架来研究相对偏见的传播;(3)评估这些攻击所引发的相对歭 stigma 的程度。我们的分析显示,精神健康实体在攻击叙事网络中占据中心位置,由其在疏近中心性(p-value = 4.06e-10)和稠密聚类(Gini 系数 = 0.7)方面显著高于其他位置。drawing from an established stigmatization framework,我们的分析表明,针对精神健康障碍相关目标的标记组件相对于初始目标在生成链中的增加。综合这些见解,阐明了大型语言模型倾向于放大有害话语的结构偏好,并凸显了需要采取适当措施进行缓解的必要性。

关键词

引用

@article{arxiv.2504.06160,
  title  = {Navigating the Rabbit Hole: Emergent Biases in LLM-Generated Attack Narratives Targeting Mental Health Groups},
  author = {Rijul Magu and Arka Dutta and Sean Kim and Ashiqur R. KhudaBukhsh and Munmun De Choudhury},
  journal= {arXiv preprint arXiv:2504.06160},
  year   = {2026}
}