深度学习的极限:通过复杂性理论视角进行序列建模
机器学习
2025-03-04 v3 计算复杂性
计算机科学中的逻辑
摘要
尽管取得了显著的成功,深度学习模型在需要复杂推理和函数组合的任务上仍表现不佳。我们对结构化状态空间模型(SSMs)和 Transformer 在此类任务中的局限性进行了理论与实证研究。我们证明,单层 SSM 在不需不可怀人的状态规模的情况下,无法有效对大范围内的函数进行组合;即使采用链式思维提示技术,也需要随函数组合复杂度不利地增长的步骤数。此外,有限精度 SSM 的语言属于正则语言类。我们的实验也印证了这些理论发现。在包括各种函数组合情形、多位数乘法、动态规划和狄拉森拼图等任务上的评估中,我们发现即使采用先进的提示技术,模型也会出现显著的性能下降。模型常常依赖捷径,导致误差叠加。这一研究揭示了当前深度学习架构在计算容量方面的根本性障碍。我们强调,为实现可靠的多步骤推理和组合任务解决,需要创新解决方案,这对于推动通用人工智能的发展至关重要。
引用
@article{arxiv.2405.16674,
title = {Limits of Deep Learning: Sequence Modeling through the Lens of Complexity Theory},
author = {Nikola Zubić and Federico Soldá and Aurelio Sulser and Davide Scaramuzza},
journal= {arXiv preprint arXiv:2405.16674},
year = {2025}
}
备注
31 page, 4 theorems, 17 figures, 4 tables, ICLR 2025 Camera Ready paper