在影响之下:量化大语言模型中的说服力与警觉性
计算与语言
2026-03-17 v3 机器学习
多智能体系统
摘要
随着大语言模型(LLM)日益融入高风险人类决策领域,理解其作为顾问所引入的风险变得至关重要。要成为有用的顾问,LLM必须处理大量内容,这些内容既出于善意也出于恶意,并据此说服用户采取特定行动。这涉及两种社交能力:警觉性(确定应使用哪些信息,哪些信息应被忽略)和说服力(综合可用证据以制造说服性论点)。虽然已有研究在孤立情况下探讨了这些能力,但关于这些能力可能如何相互关联的研究仍寡言少所。本文采用简单多轮拼图解决游戏Sokoban来研究LLM说服与对其他LLM代理保持理性警觉能力的能力。我们发现,拼图解决性能、说服能力和警觉性是LLM中可分离的三种能力。单纯在游戏中表现良好并不意味着模型能够检测自己正在被误导,即使误导的可能性被明确提及。然而,LLM确实会调节其token使用方式,在 advice 为善意时使用更少的token进行推理,而在 advice 为恶意时使用更多token,尽管它们仍会被说服采取导致失败的行动。鉴于目前尚无关于LLM中说服、警觉性与任务性能关系的研究,本工作首次探讨了这三者的关系,并表明监控这三者将对AI安全的未来工作至关重要。
引用
@article{arxiv.2602.21262,
title = {Under the Influence: Quantifying Persuasion and Vigilance in Large Language Models},
author = {Sasha Robinson and Katherine M. Collins and Ilia Sucholutsky and Kelsey R. Allen},
journal= {arXiv preprint arXiv:2602.21262},
year = {2026}
}