从稀疏依赖到稀疏注意力:揭示链条思维如何增强变换器样本效率
机器学习
2025-03-06 v2 计算与语言
机器学习
摘要
链条思维(CoT)显著增强了大型语言模型(LLM)的推理性能。虽然当前的理论研究常将这种改进归因于增加的表达力和计算容量,但我们认为表达力并非 LLM 体系中的主要限制, 因为当前的大型模型在简单任务上也会失败。使用一种奇偶学习设置,我们展示了即使在表示能力足够的情况下,CoT 仍能显著提高样本效率。具体而言,随着 CoT,变换器可以在多项式样本内学习该函数,而没有 CoT 时所需的样本量是指数级。此外,我们表明 CoT 通过在输入标记之间引入稀疏顺序依赖来简化学习过程,并导致稀疏且可解释的注意力。我们通过合成和真实世界实验验证了理论分析,确认注意力层的稀疏性是 CoT 所引入改进的关键因素。
引用
@article{arxiv.2410.05459,
title = {From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency},
author = {Kaiyue Wen and Huaqing Zhang and Hongzhou Lin and Jingzhao Zhang},
journal= {arXiv preprint arXiv:2410.05459},
year = {2025}
}
备注
43 pages,11 figures