中文

CausalLM并非上下文学习的最优选择

机器学习 2024-02-22 v3 计算与语言

摘要

近期的经验证据表明,基于Transformer的上下文学习在使用前缀语言模型(prefixLM,其中上下文样本可相互关注)时,相较于因果语言模型(causalLM,其使用禁止上下文样本关注未来样本的自回归注意力),表现更优。尽管这一结果符合直觉,但从理论角度尚缺乏理解。本文采用理论方法,分析在特定参数构造下prefixLM与causalLM的收敛行为。我们的分析表明,两类语言模型均以线性速率收敛到其驻点,但prefixLM收敛到线性回归的最优解,而causalLM的收敛动态遵循在线梯度下降算法的动态,即使样本数量趋于无穷也无法保证最优。我们以合成与真实任务上、使用各类Transformer的实证实验补充了理论论断。我们的实验验证了在所有设定下causalLM始终逊于prefixLM。

关键词

引用

@article{arxiv.2308.06912,
  title  = {CausalLM is not optimal for in-context learning},
  author = {Nan Ding and Tomer Levinboim and Jialin Wu and Sebastian Goodman and Radu Soricut},
  journal= {arXiv preprint arXiv:2308.06912},
  year   = {2024}
}

备注

ICLR 2024 conference paper. Code available at: https://github.com/google-research/causallm_icl