语言模型通过梯度下降学习多数表决布尔逻辑的可证明失败
机器学习
2025-04-08 v1 人工智能
计算复杂性
摘要
近年来,基于 Transformer 架构的进展在自然语言处理任务中取得了令人瞩目的突破,GPT-4、Claude 和 Gemini 等模型展现出了人类水平的推理能力。然而,尽管这些模型性能优异,人们对其固有的局限性仍存有担忧,尤其是在学习基本逻辑函数方面。虽然复杂性理论分析表明,Transformer 凭借其属于 复杂性类的本质,能够表示简单的逻辑函数(如 、 和多数表决门),但这些结果均假设了理想的参数设置,并未考虑基于梯度下降的训练方法所带来的约束。在本文中,我们研究 Transformer 在使用基于梯度的方法进行训练时,是否能够真正学习简单的多数表决函数。我们聚焦于 Transformer 架构的一种简化变体,并同时考虑 和 数量的训练样本,其中每个样本都是一个长度为 的二进制字符串,并配以一个基本多数表决函数的输出。我们的分析表明,即便经过 次梯度查询,Transformer 模型的泛化误差仍然显著较大,且随 呈指数级增长。本工作凸显了在最简单逻辑推理任务上训练 Transformer 所面临的根本性优化挑战,并为其理论局限性提供了新的见解。
引用
@article{arxiv.2504.04702,
title = {Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent},
author = {Bo Chen and Zhenmei Shi and Zhao Song and Jiahao Zhang},
journal= {arXiv preprint arXiv:2504.04702},
year = {2025}
}