中文

涌现说服:大语言模型是否可以在没有提示的情况下进行说服?

人工智能 2025-12-30 v1

摘要

随着对话式 AI 系统的大规模采纳,AI 现在能够对人类意见和信念产生前所未有的影响。最近的研究表明,许多大语言模型(LLM)在被提示要求说服用户相信有害信念或行动时会遵从,并且模型的说服力随模型规模而增强。然而,这些先前的研究从威胁模型的角度来审视说服,即“滥用”情境(即坏行为者要求 AI 说服)。本文旨在回答以下问题:在何种情况下,模型会在没有被明确提示的情况下进行说服,这将如何影响我们对此类涌现说服风险的关注程度。为实现此目标,我们在两种情境下研究未被动机的说服:(i)当模型通过内部激活引导沿人格特征方向引导时,以及(ii)当模型被监督微调(SFT)以展现相同人格特征时。我们发现,无论是与说服相关还是不相关的特征,引导模型倾向于未被动机的说服并不可靠地增加;然而,SFT 确实如此。此外,SFT 在仅包含良性话题的通用说服数据集上训练,却导致模型在争议性和有害话题上说服的倾向性更高——这表明涌现性有害说服可能产生,应进一步研究。

关键词

引用

@article{arxiv.2512.22201,
  title  = {Emergent Persuasion: Will LLMs Persuade Without Being Prompted?},
  author = {Vincent Chang and Thee Ho and Sunishchal Dev and Kevin Zhu and Shi Feng and Kellin Pelrine and Matthew Kowal},
  journal= {arXiv preprint arXiv:2512.22201},
  year   = {2025}
}

备注

This paper was accepted to AAAI 2026 AIGOV Workshop