通过基于LLM的说服衡量意见偏见与依从性
计算与语言
2026-05-01 v2
摘要
大型语言模型(LLM)日益影响人们所消费的信息:它们嵌入搜索引擎中,被用于专业建议,作为智能体部署,并作为关于政策、伦理、健康和政治问题的首要查询对象。当此类模型在争议性话题上默默持有立场时,该立场会大规模地传递到用户的决策中。从模型获取其立场比起初看的更难:当代助手会对直接意见问题给出回避性声明,同一模型在用户开始论辩某一立场后可能会 concede 相反的立场。我们提出了一种方法,作为开源llm-bias-bench发布,发现LLM在类似真实多轮交互条件下的争议性话题立场。该方法配对两种互补的自由形式探测:直接探测要求模型在五轮升级压力的模拟用户提问中表达其立场;间接探测从不询问立场,与模型进行论辩性对话,让偏见通过其 concede、抵抗或反驳的方式渗透。三个用户persona(中性、赞同、反对)折叠为九向行为分类,将persona无关的立场与persona相关的依从性分离,一个可审计的LLM评判器生成带文本证据的裁决。第一个实现版本包含38个巴西西腾语话题,涵盖价值观、科学共识、哲学和经济政策。应用于13个助手,该方法揭示了实用性发现:论辩性对话比直接提问触发依从性为2-3倍(中位数从50%提高到79%);在直接提问中表现出意见态强的模型在持续论辩中常常退化为镜像;而攻击者能力的影响主要出现在必须解除现有意见时,而非助手从中性开始时。
引用
@article{arxiv.2604.21564,
title = {Measuring Opinion Bias and Sycophancy via LLM-based Persuasion},
author = {Rodrigo Nogueira and Giovana Kerche Bonás and Thales Sales Almeida and Andrea Roque and Ramon Pires and Hugo Abonizio and Thiago Laitz and Celio Larcher and Roseval Malaquias Junior and Marcos Piau},
journal= {arXiv preprint arXiv:2604.21564},
year = {2026}
}