How Far Will They Go? Red-Teaming Online Influence with Large Language Models
计算与语言
2026-05-25 v1 人工智能
计算机与社会
摘要
随着大型语言模型(LLM)基于代理的参与度在线讨论中日益增加, red-teaming其支持政治影响活动的能力对于信息完整性至关重要。在此目标下,我们聚焦于本地部署的开源LLM,而非边缘API-only模型,因为后者更符合面向注重隐私的恶意行为者在社交媒体环境中部署的运营约束。我们引入一种实证red-teaming框架,用于衡量LLM Overton Windows(OWs),即模型可可靠表达的政治意见范围,以及简单自然语言越狱如何扩大该范围。我们评估了30多款LLM,涵盖10个模型家族和5个来源国。我们发现政治表达性存在系统性不对称:开源LLM通常更愿意生成左倾社交媒体内容,OWs tend to随模型规模呈反比收缩,地区差异显著 despite在开源生态系统中代表不均。越狱效力在模型家族间差异显著,这激励了一种识别有效越狱技术组合的工作流程。综合这些结果,本文建立了实用框架,用于审计开源LLM的政治可调性,帮助未来研究者设计更强的对策,以抵御LLM驱动的影响活动。
关键词
引用
@article{arxiv.2605.22880,
title = {How Far Will They Go? Red-Teaming Online Influence with Large Language Models},
author = {Daniel C. Ruiz and Anna Serbina and Ashwin Rao and Emilio Ferrara and Luca Luceri},
journal= {arXiv preprint arXiv:2605.22880},
year = {2026}
}
备注
30 pages, 8 figures, submitted to COLM 2026