CausalLM并非上下文学习的最优选择
机器学习
2024-02-22 v3 计算与语言
摘要
近期的经验证据表明,基于Transformer的上下文学习在使用前缀语言模型(prefixLM,其中上下文样本可相互关注)时,相较于因果语言模型(causalLM,其使用禁止上下文样本关注未来样本的自回归注意力),表现更优。尽管这一结果符合直觉,但从理论角度尚缺乏理解。本文采用理论方法,分析在特定参数构造下prefixLM与causalLM的收敛行为。我们的分析表明,两类语言模型均以线性速率收敛到其驻点,但prefixLM收敛到线性回归的最优解,而causalLM的收敛动态遵循在线梯度下降算法的动态,即使样本数量趋于无穷也无法保证最优。我们以合成与真实任务上、使用各类Transformer的实证实验补充了理论论断。我们的实验验证了在所有设定下causalLM始终逊于prefixLM。
引用
@article{arxiv.2308.06912,
title = {CausalLM is not optimal for in-context learning},
author = {Nan Ding and Tomer Levinboim and Jialin Wu and Sebastian Goodman and Radu Soricut},
journal= {arXiv preprint arXiv:2308.06912},
year = {2024}
}
备注
ICLR 2024 conference paper. Code available at: https://github.com/google-research/causallm_icl