驯服机器: 人格化如何增加大语言模型的脆弱性
人工智能
2025-05-20 v1 计算与语言
摘要
大语言模型(LLMs)正在增加在需要采用人格化的交互中部署的比例。本文探讨了这种人格化条件是否影响大语言模型在面对欺凌时的安全性——这是一种对抗性操纵,通过施加心理压力迫使受害者遵从攻击者。我们引入了一个模拟框架,其中攻击者大语言模型使用基于心理学的欺凌策略与受害者大语言模型交互,而受害者采用与大五人格特征相匹配的人格化。使用多个开源大语言模型和广泛的对抗性目标进行实验,揭示了某些人格配置(如削弱的宜人性或尽责性)显著增加受害者产生不安全输出的易感性。涉及情感或讽刺性操纵的欺凌策略(如精神虐待和嘲讽)尤其有效。这些发现表明,人格化驱动的交互为大语言模型引入了一种新的安全风险向量,并强调了对人格化安全评估和对齐策略的需要。
引用
@article{arxiv.2505.12692,
title = {Bullying the Machine: How Personas Increase LLM Vulnerability},
author = {Ziwei Xu and Udit Sanghi and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:2505.12692},
year = {2025}
}