通过训练动力学对“逆转诅咒”的理论理解
机器学习
2024-10-29 v2 计算与语言
摘要
自回归大型语言模型(LLM)在解决许多复杂推理任务时表现出令人印象深刻的能力,但在一些简单的逻辑推理任务(如逆向搜索)上却表现不佳:当训练于“”(例如,“Tom是John的父母”)时,LLM在推理过程中无法直接得出“”(例如,“John是Tom的孩子”),即使这两个句子在语义上是相同的,这被称为“逆转诅咒”。本文通过(随机)梯度下降的训练动力学,从理论上分析了两种自回归模型的逆转诅咒:(1)一个双线性模型,可视为单层Transformer的简化;(2)在特定假设下的单层Transformer。我们的分析揭示,对于这两种模型,逆转诅咒是(有效)模型权重“非对称性”的结果,即在训练过程中从令牌到令牌的权重增加并不必然导致从到的权重增加,这是由于在特定损失函数选择和模型参数优化空间下的训练动力学所致。此外,我们的分析可以自然地应用于其他逻辑推理任务,如思维链(COT),这提供了与以往关注表达能力的工作不同的新视角。最后,我们通过实验在不同设置下的多层Transformer上验证了我们的理论。我们的代码可在https://github.com/marlo-z/reversal_curse_analysis/获取。
引用
@article{arxiv.2405.04669,
title = {Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics},
author = {Hanlin Zhu and Baihe Huang and Shaolun Zhang and Michael Jordan and Jiantao Jiao and Yuandong Tian and Stuart Russell},
journal= {arXiv preprint arXiv:2405.04669},
year = {2024}
}
备注
41 pages, 18 figures, NeurIPS 2024