LLM知识脆弱:真理性表征依赖于表面相似性
计算与语言
2025-10-15 v1 机器学习
摘要
对于大型语言模型(LLM)而言,必须学习稳健的知识,以便在与训练期间不同且多样化的环境中可被广泛应用。然而,大量研究表明LLM性能可能脆弱,模型对输入的细微变动表现出过度敏感。在本工作中,我们探讨了这种脆弱性是否直接源于不稳定的内部知识表征。为探索此问题,我们延续了表明LLM表征编码了语句真理性的先前工作,即真实、事实的语句可以轻易地与虚假、不准确的语句区分开来。具体而言,我们通过对样本进行表面变换以驱使其远离训练分布(Out-of-Distribution, OOD),来测试所学知识的鲁棒性。通过应用保持语义的扰动,我们研究了随着语句变得更加OOD,表征可分性如何退化。在四个LLM家族、五个评估数据集和三个知识探测方法中进行实验。我们的结果揭示,随着样本呈现方式变得不像训练期间的样子,语句真理性的内部表征会退化。尽管LLM通常能够在语句表面形式接近训练数据时区分真假陈述,但这种能力高度依赖于语句的确切表面形式。这些发现为脆弱基准性能提供了可能的解释:LLM可能学习了浅层、非稳健的知识表征,仅允许有限的可泛化性。我们的工作提出了对真理性探测工具实用性的根本性挑战,并更广泛地呼吁进一步研究以提高所学知识表征的鲁棒性。
引用
@article{arxiv.2510.11905,
title = {LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance},
author = {Patrick Haller and Mark Ibrahim and Polina Kirichenko and Levent Sagun and Samuel J. Bell},
journal= {arXiv preprint arXiv:2510.11905},
year = {2025}
}