语言模型是否为未来的 token 提前规划?
机器学习
2024-08-05 v2 计算与语言
摘要
Transformer 在给定位置的推理过程中是否会“提前思考”?已知 Transformer 会在时间步 的前向传播隐藏状态中准备信息,这些信息随后在未来的前向传播 中被使用。我们对这一现象提出两种解释:一是预缓存,即训练期间出现的非对角梯度项导致模型在 时刻计算与当前推理任务无关但对未来有用的特征;二是面包屑,即与时间步 最相关的特征已经与对未来时间步 推理最有益的特征相同。我们通过训练不将梯度传播至过去时间步的语言模型来检验这些假设,并将这一方案形式化为近视训练。在构建的合成数据环境中,我们发现了预缓存的明确证据。在自回归语言建模环境中,我们的实验更倾向于支持面包屑假设,尽管预缓存现象会随模型规模增大而增加。
引用
@article{arxiv.2404.00859,
title = {Do language models plan ahead for future tokens?},
author = {Wilson Wu and John X. Morris and Lionel Levine},
journal= {arXiv preprint arXiv:2404.00859},
year = {2024}
}
备注
24 pages, 11 figures. Camera-ready for COLM 2024