中文

语言模型通过梯度下降学习多数表决布尔逻辑的可证明失败

机器学习 2025-04-08 v1 人工智能 计算复杂性

摘要

近年来,基于 Transformer 架构的进展在自然语言处理任务中取得了令人瞩目的突破,GPT-4、Claude 和 Gemini 等模型展现出了人类水平的推理能力。然而,尽管这些模型性能优异,人们对其固有的局限性仍存有担忧,尤其是在学习基本逻辑函数方面。虽然复杂性理论分析表明,Transformer 凭借其属于 TC0\mathsf{TC}^0 复杂性类的本质,能够表示简单的逻辑函数(如 AND\mathsf{AND}OR\mathsf{OR} 和多数表决门),但这些结果均假设了理想的参数设置,并未考虑基于梯度下降的训练方法所带来的约束。在本文中,我们研究 Transformer 在使用基于梯度的方法进行训练时,是否能够真正学习简单的多数表决函数。我们聚焦于 Transformer 架构的一种简化变体,并同时考虑 n=poly(d)n=\mathrm{poly}(d)n=exp(Ω(d))n=\exp(\Omega(d)) 数量的训练样本,其中每个样本都是一个长度为 dd 的二进制字符串,并配以一个基本多数表决函数的输出。我们的分析表明,即便经过 poly(d)\mathrm{poly}(d) 次梯度查询,Transformer 模型的泛化误差仍然显著较大,且随 dd 呈指数级增长。本工作凸显了在最简单逻辑推理任务上训练 Transformer 所面临的根本性优化挑战,并为其理论局限性提供了新的见解。

关键词

引用

@article{arxiv.2504.04702,
  title  = {Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent},
  author = {Bo Chen and Zhenmei Shi and Zhao Song and Jiahao Zhang},
  journal= {arXiv preprint arXiv:2504.04702},
  year   = {2025}
}