噪声对LLM模型在抽象推理语料库(ARC)任务中的性能影响及模型温度考量
人工智能
2025-04-25 v2
摘要
近期大型语言模型(LLM)的进步引发了对其结构化推理能力的日益关注,尤其是涉及抽象和模式识别的任务。抽象推理语料库(ARC)基准在评估这些能力方面发挥着关键作用,通过测试AI模型对新问题的泛化能力。虽然GPT-4o在零噪声条件下能解决所有ARC任务,但其他模型如DeepSeek R1和LLaMA 3.2却未能解决任何任务,表明其在超越简单模式匹配方面存在局限。为探索这一差距,我们系统评估了这些模型在不同噪声水平和温度设置下的表现。我们的结果表明,无论架构如何,噪声的引入始终会损害模型性能。这一下降凸显了当前LLM的一个共同脆弱性:尽管展现出一定的抽象推理迹象,但它们对输入扰动极其敏感。这种脆弱性引发了对其实际应用的担忧,而在实际场景中噪声和不确定性十分常见。通过比较不同模型架构对这些挑战的响应方式,我们提供了对现代LLM在推理任务中结构性弱点的洞见。这一工作强调了开发更具鲁棒性和适应性AI系统的必要性,而这些系统能够处理现实场景中固有的模糊性和变动性。我们的发现旨在指导未来的研究,致力于提升模型的泛化、鲁棒性与人类类认知灵活性之间的一致性。
引用
@article{arxiv.2504.15903,
title = {Impact of Noise on LLM-Models Performance in Abstraction and Reasoning Corpus (ARC) Tasks with Model Temperature Considerations},
author = {Nikhil Khandalkar and Pavan Yadav and Krishna Shinde and Lokesh B. Ramegowda and Rajarshi Das},
journal= {arXiv preprint arXiv:2504.15903},
year = {2025}
}
备注
60 pages, 25 figures