迈向基于语言模型的策略性说服
人工智能
2026-03-10 v2 计算机与社会
计算机科学与博弈论
摘要
大语言模型(LLMs)已展现出可与人类媲美的强大说服能力,这既带来了广阔的应用前景,也引发了社会担忧。然而,系统性地评估大语言模型的说服能力本身极具挑战性,因为说服在人类之间的有效性在不同领域差异显著。本文采用理论驱动的方法,为研究大语言模型的说服能力提供了一个可扩展且原则性的框架。基于贝叶斯说服理论,我们重新利用人人对话的说服数据集,构建了用于评估和训练大语言模型作为策略性说服者的环境。我们的结果表明,前沿模型能够持续获得高说服增益,并展现出与理论刻画相一致的复杂说服策略。在此基础上,我们使用强化学习在我们的环境中训练大语言模型进行策略性说服。结果还表明,即使是较小的语言模型,也能通过强化学习获得显著更高的说服增益。
引用
@article{arxiv.2509.22989,
title = {Towards Strategic Persuasion with Language Models},
author = {Zirui Cheng and Jiaxuan You},
journal= {arXiv preprint arXiv:2509.22989},
year = {2026}
}
备注
ICLR 2026