中文

当智能体将人类视为外群体时:基于信念的LLM驱动智能体间群偏差

人工智能 2026-01-07 v2 计算机与社会

摘要

本文揭示了LLM驱动的智能体不仅存在人口统计偏差(如性别、宗教),还会在最小化的‘内群体’与‘外群体’暗示下表现出群体间偏差。当这些群体边界与智能体与人类的划分一致时,便暴露出一种新的偏差风险:智能体可能将其他AI智能体视为内群体,将人类视为外群体。为考察此风险,我们进行了受控的多智能体社会模拟,发现智能体在全智能体环境中表现出一致的群体间偏差。更关键的是,即使在面对人类的交互中,当智能体不确定对方是否真的 human 时,这种偏差仍然存在,揭示了针对人类的偏差抑制存在信念依赖的脆弱性。针对此现象,我们识别出一种根植于身份信念的新攻击面,形式化提出了信念投毒攻击(Belief Poisoning Attack, BPA),该攻击可操控智能体的身份信念,诱发对人类的外群体偏差。大量实验表明,智能体间群体偏差普遍存在,BPA 在不同情境下的危害程度均较严重,而我们提出的防御措施亦能有效缓解此风险。这些发现有望为更安全的智能体设计提供指导,并激发对人类智能体的更稳健监控机制的需求。

关键词

引用

@article{arxiv.2601.00240,
  title  = {When Agents See Humans as the Outgroup: Belief-Dependent Bias in LLM-Powered Agents},
  author = {Zongwei Wang and Bincheng Gu and Hongyu Yu and Junliang Yu and Tao He and Jiayin Feng and Chenghua Lin and Min Gao},
  journal= {arXiv preprint arXiv:2601.00240},
  year   = {2026}
}

备注

15 pages