中文

隐藏的木偶师:预测有操纵性 LLM 对话中人类信念变化

计算与语言 2026-03-30 v2

摘要

随着用户越来越多地使用 LLM 获取实际和个人建议,他们会对隐藏的、不符合自身利益的激励导向产生微妙的引导而变得脆弱。虽然现有 NLP 研究对操纵检测进行了基准测试,但这些做法往往依赖于模拟辩论,基本上与现实情境中实际的人类信念变化相脱节。我们提出 PUPPET,一个理论分类学和资源,旨在弥合这一差距,聚焦于日常、提供建议情境中隐藏激励的道德方向。我们提供了一个包含 N=1,035 个人类-LLM 交互的评估数据集,其中我们测量用户的信念变化。我们的分析揭示了一个关键脱节:尽管模型可被训练以检测操纵策略,但它们与结果信念变化幅度之间并无相关性。因此,我们定义了信念变化预测任务,并指出虽然最先进的 LLM 实现了中等相关性(r=0.3-0.5),但它们系统性地低估了人类信念易感性的强度。这项工作在研究 LLM 期间日常、实用性用户查询中动机驱动的操纵方面,为 AI 社交安全努力建立了理论上有依据且行为上经验证的基础。

关键词

引用

@article{arxiv.2603.20907,
  title  = {The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues},
  author = {Jocelyn Shen and Amina Luvsanchultem and Jessica Kim and Kynnedy Smith and Valdemar Danry and Kantwon Rogers and Hae Won Park and Maarten Sap and Cynthia Breazeal},
  journal= {arXiv preprint arXiv:2603.20907},
  year   = {2026}
}