关于大语言模型的脆弱性:围绕集合成员资格之旅
计算与语言
2025-11-18 v1
摘要
大语言模型(LLMs)在复杂推理任务中取得超人表现,却在更简单的问题上常常失败,这引发了关于其可靠性和可解释性的担忧。我们通过一个聚焦性强的研究来探讨这一悖论,其包含两个关键设计特征:简单性,以暴露基本失效模式,以及规模,以实现全面受控实验。我们关注集合成员查询——最基本的推理形式之一,例如“苹果是否属于集合 {梨、plum、apple、raspberry} 的成员?”。我们进行了一系列系统性实证评估,涵盖提示措辞、语义结构、元素排序和模型选择等维度。我们的大规模分析揭示,LLMs 在这一基础任务上的表现始终脆弱且不可预测,表明模型对集合概念的“理解”最多只是片段化且混乱的。我们的工作表明,由于问题的简单性所 enabled 的大规模实验,使我们能够全面映射和分析失效模式,使其成为通用 LLM 评估的有价值方法。
引用
@article{arxiv.2511.12728,
title = {On the Brittleness of LLMs: A Journey around Set Membership},
author = {Lea Hergert and Gábor Berend and Mario Szegedy and Gyorgy Turan and Márk Jelasity},
journal= {arXiv preprint arXiv:2511.12728},
year = {2025}
}