大规模人口统计提示:何时更多属性会损害LLM与人类的一致性
计算与语言
2026-07-12 v1
摘要
我们研究了标注者的人口统计属性(作为提示线索提供)如何影响大型语言模型(LLM)预测与人类标注在五个任务上的一致性。使用五个开源LLM,我们系统地改变了提示中人口统计组件的数量和组成,涵盖了从单属性到全属性配置的每一种组合。我们的实验揭示了三个主要发现。首先,一致性在包含一到三个高信号属性时持续达到峰值,并在完整属性集下退化,确立了一个明确的过度指定阈值。其次,人口统计属性对人类标注的总体影响程度并不能预测哪些属性会改善LLM一致性;相反,需要联合考虑每个属性标注信号的可学习性和方向一致性。第三,神经元探测揭示,只有在连贯的标注信号下,专门化的激活才与一致性提升相关,并且激活量本身并不意味可引导性。总之,这些结果表明人口统计提示并非单一干预:其效用高度依赖于上下文,受属性信号质量、任务特征和模型架构的影响。
引用
@article{arxiv.2607.10590,
title = {Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement},
author = {Mahammed Kamruzzaman and Shrabon Kumar Das and Gene Louis Kim},
journal= {arXiv preprint arXiv:2607.10590},
year = {2026}
}