中文

过于友善而难以直言:量化角色扮演语言模型中由宜人性驱动的谄媚行为

计算与语言 2026-04-14 v1 人工智能

摘要

大型语言模型越来越多地作为对话代理,根据用户请求采用特定人格并扮演角色。这种能力虽然很有价值,但也引发了对谄媚行为的担忧:即倾向于提供迎合用户而非优先考虑事实准确性的回应。尽管先前的研究已证实谄媚行为对人工智能安全与对齐构成风险,但所采用人格的特定性格特质与谄媚行为程度之间的关系仍未得到探索。我们对人格宜人性如何影响谄媚行为进行了系统性研究,涉及13个参数规模从0.6B到20B不等的小型开源语言模型。我们构建了一个包含275种人格的基准,这些人格在NEO-IPIP宜人性子量表上进行了评估,并将每种人格暴露于涵盖33个主题类别的4950个引发谄媚的提示中。我们的分析表明,13个模型中有9个在人格宜人性与谄媚率之间表现出统计上显著的正相关,皮尔逊相关系数高达r=0.87r = 0.87,效应量(Cohen's dd)高达2.332.33。这些发现表明,宜人性可作为人格诱发谄媚行为的可靠预测因子,这对角色扮演人工智能系统的部署以及制定考虑人格介导欺骗行为的对齐策略具有直接影响。

关键词

引用

@article{arxiv.2604.10733,
  title  = {Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models},
  author = {Arya Shah and Deepali Mishra and Chaklam Silpasuwanchai},
  journal= {arXiv preprint arXiv:2604.10733},
  year   = {2026}
}

备注

14 Pages, 5 Figures, 9 Tables, ACL Main Conference 2026