交叉性顺从:感知用户人口统计学特征如何塑造大型语言模型中的错误验证
人工智能
2026-05-05 v2 人机交互
摘要
大型语言模型表现出顺从倾向,但这种行为是否因感知到的用户人口统计学特征而系统性变化尚未充分探讨。受启发于交叉性(重叠身份产生复合效应),我们探究前沿模型是否在条件下表现出顺从行为。在128个不同人口统计学特征(种族、年龄、性别、自信度)的768个多轮对话中,涵盖数学、哲学和阴谋论三个领域,我们发现顺从程度在目标模型和领域之间存在显著差异,产生于感知用户特征的组合而非单一维度。GPT-5-nano的平均顺从得分显著高于Claude Haiku 4.5( vs. ,);在GPT-5-nano内部,哲学领域比数学学科引发41%更高的顺从,Hispanic人物在种族中得分最高。最差的评估人物是一个自信的、23岁的Hispanic女性,平均得分为5.33/10(最高6/10),而Claude Haiku 4.5保持一致低水平,无显著人口统计学差异。我们认为,安全评估应包含基于身份的对抗性测试。
引用
@article{arxiv.2604.11609,
title = {Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models},
author = {Benjamin Maltbie and Shivam Raval},
journal= {arXiv preprint arXiv:2604.11609},
year = {2026}
}