中文

如果你可以说服我:评估大语言模型说服力与易受说服性的框架

计算与语言 2026-05-28 v4 人工智能 机器学习 多智能体系统

摘要

大语言模型(LLM)展示出与人类水平相当的说服能力。虽然这些能力可用于社会利他,但也存在潜在滥用风险。除了关注 LLM 如何说服他人外,它们自身对说服的易受性也是一个关键的对齐挑战,这引发了关于鲁棒性、安全性和遵守伦理原则的问题。为研究这些动态,我们引入 Persuade Me If You Can (PMIYC),一个用于评估多智能体交互中说服力和易受说服性的自动化框架。我们的框架为评估 LLM 中的说服力提供了可扩展的替代方案,避免了通常用于研究 LLM 说服力的昂贵且耗时的众包标注过程。PMIYC 自动进行 Persuader 和 Persuadee 代理之间的多轮对话,衡量说服的效果及其易受说服性。我们的全面评估涵盖多样化的 LLM 和说服情境(例如主观情境和误导情境)。我们通过人类评估验证了框架的有效性,并证明其与先前研究中人类评估的一致性。通过 PMIYC,我们发现 Llama-3.3-70B 和 GPT-4o 在说服效果方面表现相似,均超过 Claude 3 Haiku 30%。然而,GPT-4o 在误导情境下的抗说服能力比 Llama-3.3-70B 高逾 50%。值得注意的是,o4-mini 同时表现出良好的说服能力和抗说服能力。这些发现为理解 LLM 的说服动态提供了实证依据,并有助于开发更安全的人工智能系统。

关键词

引用

@article{arxiv.2503.01829,
  title  = {Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models},
  author = {Nimet Beyza Bozdag and Shuhaib Mehri and Gokhan Tur and Dilek Hakkani-Tür},
  journal= {arXiv preprint arXiv:2503.01829},
  year   = {2026}
}

备注

Paper published at the ACM Conference on AI and Agentic Systems 2026