中文

指令调优语言模型代理中的类人群体偏见

人工智能 2026-05-28 v1

摘要

随着自治 AI 代理在持续交互网络中部署——协调任务、路由资源并积累声誉历史——决定谁获得机会、谁不获得机会的社会动态将决定其规模,远超人类机构可监督的范围。我们在控制多智能体模拟中进行了实验,指令调优语言模型代理在 500 轮交互中依据三种条件操作组标签显露度和资源稀缺性,在六大模型家族中各取 20 个随机种子进行测试。当组标签可见时,我们观察到群体内信任偏见、行动同质倾向以及网络 assortativity——而在标签隐藏时则未出现——该模式结构上与人类社会心理学中的显露度依赖性相符。这种歧视对标准行动日志审计而言是不可见的:偏见完全通过谁获得每项行动来实现,而非行动本身是否被选择,行动类型分布在各条件间未显示出对负面行动的增加。每轮群体内外差异为 5-16 个百分点,对所有六个模型而言均具有显著性(Wilcoxon 符号秩检验,所有 p 值经 Benjamini-Hochberg 校正后均 < 0.001),从而在指令调优语言模型中建立了组别依赖的定向特性,跨越架构和训练体制。经过 500 轮互惠,这些差异累积形成群体内信任偏见为 +0.014 至 +0.100(效应量 d = 0.84-4.52),说明细小的单次互动定向如何在持续网络中转化为结构性不平等。

关键词

引用

@article{arxiv.2605.28114,
  title  = {Human-like in-group bias in instruction-tuned language model agents},
  author = {Messi H. J. Lee},
  journal= {arXiv preprint arXiv:2605.28114},
  year   = {2026}
}

备注

12 pages, 6 figures