论大语言模型的对话说服力:一项随机对照试验
计算机与社会
2025-05-21 v1
摘要
大语言模型(LLMs)的发展与普及引发了对其被用于制造量身定制、令人信服的论点,以在线传播虚假或误导性叙事的担忧。早期研究发现,语言模型生成的内容被认为至少与人类撰写的信息不相上下,且往往更具说服力。然而,关于LLMs在与人类对手直接对话中的说服能力,以及个性化如何提升其表现,目前了解仍然有限。在这项预注册研究中,我们于一个受控、无害的环境中分析了人工智能驱动说服的效果。我们创建了一个基于网络的平台,参与者在此与一位实时对手进行简短的多轮辩论。每位参与者被随机分配到四种处理条件之一,对应一个二乘二的析因设计:(1) 游戏要么在两位人类之间进行,要么在一位人类与一个LLM之间进行;(2) 个性化可能启用或未启用,允许两位玩家中的一位获取对手的基本社会人口信息。我们发现,与GPT-4辩论且能获取其个人信息的参与者,相较于与人类辩论的参与者,其与对手达成更高一致性的几率高出81.7%(p < 0.01;N=820位独立参与者)。在无个性化的情况下,GPT-4仍优于人类,但效果较小且统计上不显著(p=0.31)。总体而言,我们的结果表明,围绕个性化的担忧是有意义的,并对社交媒体治理及新型在线环境的设计具有重要启示。
引用
@article{arxiv.2403.14380,
title = {On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial},
author = {Francesco Salvi and Manoel Horta Ribeiro and Riccardo Gallotti and Robert West},
journal= {arXiv preprint arXiv:2403.14380},
year = {2025}
}
备注
33 pages, 10 figures, 7 tables