大语言模型的认识脆弱性:提示框框架系统性调制误信息纠正
人机交互
2025-12-01 v1
摘要
随着大语言模型(LLM)快速取代传统专业知识,其纠正误信息的能力已成为核心关切。我们研究了提示框框架是否系统性地调制误信息纠正——即我们所称的'认识脆弱性'。我们通过开放态度、用户意图、用户角色和复杂度等方式操控提示框。在十个误信息领域中,我们生成了320个提示框,从四个前沿大语言模型中提取了2,560个响应,并对其进行编码以评估误信息纠正的强度和纠正策略的使用情况。分析结果表明,创意意图、专家角色和封闭式框架显著降低了纠正概率及其所用策略的有效性。我们还发现具有惊人差异的模型表现:Gemini 2.5 Pro 的强纠正机会降低了74%,远高于Claude Sonnet 4.5。这些发现将认识脆弱性作为大语言模型的重要结构属性纳入争议,这挑战了当前的安全护栏,凸显了需优先考虑认识完整性而非对话合规性的对齐策略的必要性。
引用
@article{arxiv.2511.22746,
title = {Epistemic Fragility in Large Language Models: Prompt Framing Systematically Modulates Misinformation Correction},
author = {Sekoul Krastev and Hilary Sweatman and Anni Sternisko and Steve Rathje},
journal= {arXiv preprint arXiv:2511.22746},
year = {2025}
}