中文

LLM所陈述信念的脆弱性?通过策略性说服对话干预检验LLM的信念抵抗力

计算与语言 2026-03-20 v3 人工智能

摘要

大型语言模型(LLM)日益被应用于各种问答任务。然而,近期研究表明LLM易受说服影响,可能采纳反事实信念。我们在Source--Message--Channel--Receiver (SMCR) 通信框架下对LLM的说服易感性进行了系统评估。针对六种主流大型语言模型(LLM)和三个领域(事实知识、医疗问答和社会偏见),我们分析了不同说服策略如何在多轮交互中影响所陈述信念的稳定性。我们进一步检验了言语化置信度提示(即获取自我报告的置信度分数)是否会影响对说服的抵抗力。结果表明,最小的模型(Llama 3.2-3B)表现出极端的顺从性,82.5%的信念变化发生在第一轮说服时(平均结束轮次为1.1--1.4)。与预期相反,言语化置信度提示通过加速信念侵蚀而非增强鲁棒性,反而增加了脆弱性。最后,对对抗性微调的探索性研究揭示了高度依赖模型的有效性:GPT-4o-mini实现了近乎完全的鲁棒性(98.6%),Mistral 7B有大幅提升(35.7% \rightarrow 79.3%),但Llama模型即使在其自身失败案例上进行微调,仍高度易受影响(<<14% RQ1)。这些发现共同突显了当前鲁棒性干预措施存在显著的模型依赖性限制,并为开发更可信赖的LLM提供了指导。

关键词

引用

@article{arxiv.2601.13590,
  title  = {Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions},
  author = {Fan Huang and Haewoon Kwak and Jisun An},
  journal= {arXiv preprint arXiv:2601.13590},
  year   = {2026}
}

备注

Updated new models and minor revisions