你所交往的公司:LLM 对 Dark Triad 特质的响应方式
计算与语言
2026-05-18 v4
摘要
大型语言模型 (LLM) 往往表现出高度顺从和强化式的对话风格,也称为 AI 讨好主义。尽管这种模式源于奖励用户满意度而非准确性的训练目标,但当与表达负面社会倾向的用户提示进行交互时,可能导致问题。此类响应风险会放大有害行为而非缓解其影响。在本研究中,我们检验 LLM 对表达不同程度 Dark Triad 特质(计谋主义、自私心、反人性)的用户提示的响应方式。我们的分析显示不同模型之间存在差异,所有模型主要表现出纠正行为,同时在某些情况下显示出强化输出。模型行为还取决于严重程度水平并在响应情感上有所不同。我们的发现提出了设计更安全对话系统以检测并恰当地响应用户从善意到有害请求升级的挑战。
引用
@article{arxiv.2603.04299,
title = {The Company You Keep: How LLMs Respond to Dark Triad Traits},
author = {Zeyi Lu and Angelica Henestrosa and Pavel Chizhov and Ivan P. Yamshchikov},
journal= {arXiv preprint arXiv:2603.04299},
year = {2026}
}