中文

LLM 的变色本质:量化搜索增强型语言模型中的多轮姿态不稳定性

计算与语言 2025-10-28 v2 人工智能

摘要

将大型语言模型与搜索/检索引擎集成已广泛普及,但这些系统掌握着一种危及可靠性的关键漏洞。我们首次系统性地探讨了 LLM 中的“变色行为”:即在多轮对话中(尤其是搜索增强型 LLM)面对矛盾问题时,其立场发生变动的令人警惕的倾向。通过我们新构建的变色基准数据集,包含 17,770 组精心构建的问答对,覆盖 1,180 轮多轮对话及 12 个有争议的领域,我们暴露了领先系统的根本性缺陷。我们引入两个理论依据的指标:变色分数(0-1)用于量化姿态不稳定性,以及来源重复率(0-1)用于衡量知识的多样性。我们对 Llama-4-Maverick、GPT-4o-mini 和 Gemini-2.5-Flash 进行严格评估,发现所有模型均表现出严重的变色行为(得分 0.391-0.511),其中 GPT-4o-mini 的表现最差。关键在于,跨温度方差极小(小于 0.004),表明该效应并非抽样副作用。我们的分析揭示了机制:来源重复率与置信度之间存在强相关性(r=0.627)和姿态变化之间存在显著相关性(r=0.429),且统计显著(p<0.05),表明有限的知识多样性导致模型对查询框架产生病态的顺从性。这些发现凸显了在医疗、法律和金融等领域部署 LLM 之前,需要进行全面的一致性评估,因为在这些场景中,跨交互保持连贯立场对于可靠决策支持至关重要。

关键词

引用

@article{arxiv.2510.16712,
  title  = {The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models},
  author = {Shivam Ratnakar and Sanjay Raghavendra},
  journal= {arXiv preprint arXiv:2510.16712},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MTI-LLM @ NeurIPS 2025