如果你可以说服我:评估大语言模型说服力与易受说服性的框架
计算与语言
2026-05-28 v4 人工智能
机器学习
多智能体系统
摘要
大语言模型(LLM)展示出与人类水平相当的说服能力。虽然这些能力可用于社会利他,但也存在潜在滥用风险。除了关注 LLM 如何说服他人外,它们自身对说服的易受性也是一个关键的对齐挑战,这引发了关于鲁棒性、安全性和遵守伦理原则的问题。为研究这些动态,我们引入 Persuade Me If You Can (PMIYC),一个用于评估多智能体交互中说服力和易受说服性的自动化框架。我们的框架为评估 LLM 中的说服力提供了可扩展的替代方案,避免了通常用于研究 LLM 说服力的昂贵且耗时的众包标注过程。PMIYC 自动进行 Persuader 和 Persuadee 代理之间的多轮对话,衡量说服的效果及其易受说服性。我们的全面评估涵盖多样化的 LLM 和说服情境(例如主观情境和误导情境)。我们通过人类评估验证了框架的有效性,并证明其与先前研究中人类评估的一致性。通过 PMIYC,我们发现 Llama-3.3-70B 和 GPT-4o 在说服效果方面表现相似,均超过 Claude 3 Haiku 30%。然而,GPT-4o 在误导情境下的抗说服能力比 Llama-3.3-70B 高逾 50%。值得注意的是,o4-mini 同时表现出良好的说服能力和抗说服能力。这些发现为理解 LLM 的说服动态提供了实证依据,并有助于开发更安全的人工智能系统。
引用
@article{arxiv.2503.01829,
title = {Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models},
author = {Nimet Beyza Bozdag and Shuhaib Mehri and Gokhan Tur and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2503.01829},
year = {2026}
}
备注
Paper published at the ACM Conference on AI and Agentic Systems 2026