中文

角色提示作为LLM社会推理的透镜

计算与语言 2026-01-29 v1

摘要

对于像仇恨言论检测这样的社会敏感任务,大型语言模型(LLM)解释的质量对于用户信任和模型对齐等因素至关重要。虽然角色提示(PP)越来越多地被用作引导模型生成用户特定内容的一种方式,但其对模型推理的影响仍未得到充分探索。我们研究了当以不同的模拟人口统计角色为条件时,LLM生成的推理如何变化。使用带有词级推理标注的数据集,我们测量了与来自不同人口统计群体的人类标注的一致性,并评估了PP对模型偏差和人类对齐的影响。我们在三个LLM上的评估结果揭示了三个关键发现:(1)PP在最主观的任务(仇恨言论)上提高了分类性能,但降低了推理质量。(2)模拟角色未能与其现实世界中的人口统计对应物对齐,并且角色间的高度一致性表明模型对显著引导具有抵抗力。(3)无论是否使用PP,模型都表现出一致的人口统计偏差和强烈倾向于将内容过度标记为有害。我们的发现揭示了一个关键的权衡:虽然PP可以提高社会敏感任务中的分类性能,但它通常以牺牲推理质量为代价,并且未能减轻潜在的偏差,这提醒我们在其应用中需谨慎。

关键词

引用

@article{arxiv.2601.20757,
  title  = {Persona Prompting as a Lens on LLM Social Reasoning},
  author = {Jing Yang and Moritz Hechtbauer and Elisabeth Khalilov and Evelyn Luise Brinkmann and Vera Schmitt and Nils Feldhus},
  journal= {arXiv preprint arXiv:2601.20757},
  year   = {2026}
}

备注

9 Pages, EACL main