模式胜于原则:在噪声观察下大语言模型归纳推理的脆弱性
人工智能
2025-05-29 v2
摘要
归纳推理是人类认知的基石,能够从有限数据中进行泛化,但尚未完全实现于大型语言模型(LLMs)。虽然现代LLMs在推理任务中表现出色,但在不完美观察下维持稳定一致的规则抽象能力仍未得到充分探索。为填补这一空白,本文引入了稳健规则归纳(Robust Rule Induction)任务,以评估LLMs从与噪声混合样本中推断规则的能力。为解决该任务,我们进一步提出了样本引导规则细化(Sample-steered Rule Refinement, SRR)方法,通过观察多样化和执行引导反馈来增强推理稳定性。实验在算术、密码学和列表函数领域均表明:(1)SRR在噪声下性能优于其他方法且最小化性能下降;(2)尽管准确率略有波动,LLMs在噪声下仍表现出不稳定性(例如仅70%一致得分却出现0%准确率变化);(3)反事实任务差距凸显LLMs依赖记忆化模式而非真正抽象化的倾向。我们的发现挑战了LLMs的推理鲁棒性,揭示了其对假设漂移和模式过拟合的脆弱性,同时为开发类人归纳系统提供了实证依据。代码和数据已公开于 https://github.com/HKUST-KnowComp/Robust-Rule-Induction。
引用
@article{arxiv.2502.16169,
title = {Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observations},
author = {Chunyang Li and Weiqi Wang and Tianshi Zheng and Yangqiu Song},
journal= {arXiv preprint arXiv:2502.16169},
year = {2025}
}